- CITY GUIDE
- PODCAST
-
17°
Internet Archive: Οι τρελοί τύποι που αρχειοθετούν τα πάντα
«Ό,τι ανεβάζουμε στο διαδίκτυο μένει εκεί για πάντα» ακούμε συχνά ως προειδοποίηση προκειμένου να είμαστε προσεκτικοί
«Ό,τι ανεβάζουμε στο διαδίκτυο μένει εκεί για πάντα» ακούμε συχνά ως προειδοποίηση προκειμένου να είμαστε προσεκτικοί. Μεγάλη ευθύνη για αυτό το γεγονός έχει το Internet Archive. Το μακρινό 1996, όταν ακόμα το διαδίκτυο ήταν ένα παιχνίδι στα εργαστήρια των πανεπιστημίων, στο Σαν Φρανσίσκο προσπαθούσαν να λύσουν ένα δύσκολο πρόβλημα. Το ίντερνετ είχε μόλις δημιουργηθεί αλλά ήταν πολύ ζωντανό. Ιστοσελίδες ανέβαιναν, άλλαζαν και κατέβαιναν με γρήγορους ρυθμούς. Το διαδίκτυο σήμερα είναι τεράστιο και αλλάζει κάθε με καταιγιστικό ρυθμό. Υπάρχουν 1,8 δισεκατομμύρια ιστοσελίδες (τα 644 εκατομμύρια είναι ενεργές) και διπλασιάζεται σε μέγεθος κάθε 2 με 5 χρόνια. Η μέση ιστοσελίδα διαρκεί μόλις 100 ημέρες και τα περισσότερα άρθρα ξεχνιούνται 5 λεπτά μετά τη δημοσίευση. Χωρίς τη δημιουργία αντιγράφων όλα αυτά θα χάνονταν στο χρόνο.
Κάτι έπρεπε να γίνει για να μην χάνεται όλη αυτή η πληροφορία. Για αυτό τον σκοπό λοιπόν ο οραματιστής Brewster Kahle ίδρυσε το το 1996 το Internet Archive, μια μη κερδοσκοπική ψηφιακή βιβλιοθήκη. Ο σκοπός του Internet Archive ήταν να αρχειοθετεί οτιδήποτε έμπαινε στο διαδίκτυο προκειμένου να μη χάνεται ποτέ τίποτα. Στην αρχή χρησιμοποιούσε το λογισμικό του για να δημιουργεί αντίγραφα του διαδικτύου στη σοφίτα του. Το όραμα του όμως ήταν να προσφέρει «καθολική πρόσβαση σε όλες τις γνώσεις», να ξεπεράσει τη βιβλιοθήκη της Αλεξάνδρειας, τη μεγαλύτερη και σημαντικότερη βιβλιοθήκη της αρχαιότητας. Για περίπου 6 χρόνια υπομονετικά αρχειοθέτησε περισσότερες από 10 δισεκατομμύρια ιστοσελίδες αλλά το κοινό δεν είχε πρόσβαση σε αυτό τον θησαυρό. Αυτό μέχρι το 2001 όταν έκανε το ντεμπούτο του το Wayback Machine, ένα εργαλείο που επιτρέπει σε όλους μας να βλέπουμε το πολύτιμο αρχείο.
Σήμερα το Wayback Machine φιλοξενεί 349 δισεκατομμύρια ιστοσελίδες και η «μαμά» του, το Internet Archive, είναι η μεγαλύτερη βιβλιοθήκη του κόσμου. Η συλλογή του Internet Archive, δεν καλύπτει μόνο τον παγκόσμιο ιστό αλλά έχει και βιβλία, ηχογραφήσεις, βίντεο, εικόνες και λογισμικό. Το μέγεθος του ανέρχεται σε περισσότερα από 40 petabytes (αυτό είναι 40 εκατομμύρια gigabytes δεδομένων) και το Wayback Machine με τις ιστοσελίδες αποτελεί πάνω από το 60%. Αυτό αντιστοιχεί σε 80 εκατομμύρια ερμάρια 4 συρταριών γεμάτα χαρτί ή σε λίγο λιγότερο από το σύνολο όλων των γραπτών της ανθρωπότητας (σε όλες τις γλώσσες) από την αρχή της καταγεγραμμένης ιστορίας μέχρι σήμερα. Η Βιβλιοθήκη του Κογκρέσου των ΗΠΑ περιέχει περίπου 28 terabytes κειμένου - λιγότερο από το 0,1% του Internet Archive.
Και πως δουλεύει όλο αυτό το καταπληκτικό σύστημα αρχειοθέτησης; Μια στρατιά από 7.000 bots (προγράμματα που εκτελούν αυτοματοποιημένες εργασίες) σκανάρουν το διαδίκτυο δημιουργώντας αντίγραφα εκατομμυρίων ιστοσελίδων. Αυτά τα αντίγραφα, που ονομάζονται «στιγμιότυπα», δημιουργούνται με διαφορετικές συχνότητες (μερικές φορές πολλές φορές την ημέρα, άλλες φορές μία φορά κάθε λίγους μήνες ανάλογα με το πόσο συχνά αλλάζει το κάθε site) και μας δίνουν την εικόνα που έχει κάθε ιστότοπος σε μια συγκεκριμένη χρονική στιγμή. Για παράδειγμα, αν βάλουμε το site της AthensVoice στο Wayback Machine θα δούμε ότι έχει αρχειοθετηθεί περίπου 1.800 φορές από το 2003 μέχρι σήμερα. Αυτό δεν σημαίνει ότι έχει αλλάξει μόνο τόσες φορές αλλά ότι τόσες φορές επιλέχθηκε από τα ρομποτάκια του Internet Archive για να δημιουργηθεί στιγμιότυπο.
Κάτι που μας πάει στο επόμενο ερώτημα. Πως επιλέγονται αυτά που θα αρχειοθετηθούν; Δημιουργούμε αντίγραφα για ένα μεγάλο μέρος του διαδικτύου αλλά όχι για το σύνολο του, λένε οι υπεύθυνοι του Internet Archive. Απαιτεί συνεχή προσπάθεια για να βρεις ποια κομμάτια του internet είναι τα πιο χρήσιμα και να δώσεις την αντίστοιχη προτεραιότητα. Και επειδή πίσω από όλα είναι οι άνθρωποι, ο τεχνικός πίσω από τα bot πρέπει να αποφασίσει από πού ξεκινήσουν και πόσο βαθιά θα πηγαίνουν όταν δημιουργούν τα αντίγραφα. Είναι φανερό ότι όλη αυτή η διαδικασία απαιτεί τεράστιους τεχνικούς και ανθρώπινους πόρους. Τα χρήματα για όλα αυτά προέρχονται από επιχορηγήσεις, δωρεές αλλά και από τη συνδρομητική υπηρεσία αρχειοθέτησης Archive-It.
ΤΑ ΠΙΟ ΔΗΜΟΦΙΛΗ
ΔΙΑΒΑΖΟΝΤΑΙ ΠΑΝΤΑ
ΔΕΙΤΕ ΕΠΙΣΗΣ
Ο Ελληνοολανδός γιατρός που προετοιμάζει τα χειρουργεία του διαστήματος
«Η Ευρώπη δεν έχει χάσει τη μάχη της AI, αλλά κινδυνεύει να αυτοϋπονομευθεί», λέει ο CEO του 28 DIGITAL
Βιολόγοι εξηγούν πώς η εξέλιξη και η ανατομία δημιούργησαν τη μοναδικότητα της ανθρώπινης φωνής
Η κλινική δοκιμή περιέλαβε περίπου 900 νεοδιαγνωσθέντες ασθενείς,
Η κλινική δοκιμή περιέλαβε περισσότερους από 4.400 ασθενείς
Νέα έρευνα δείχνει ότι οι επιχειρήσεις σχεδιάζουν μαζικές αλλαγές και λιγότερους εργαζόμενους
Ο 48χρονος προγραμματιστής και μουσικός με οπτική αναπηρία μιλά για τη ζωή σε μια αφιλόξενη Ελλάδα, την AI και τη μάχη να αντιμετωπίζεται ως άνθρωπος
Η πλατφόρμα δημιουργεί το Pornhub Sapphic, με περιεχόμενο εστιασμένο στη γυναικεία απόλαυση
Πρόκειται περί αληθινής αγγελίας – Τα προσόνα που πρέπει να έχουν οι ενδιαφερόμενοι
Βίντεο δείχνει τον πύραυλο να τυλίγεται στις φλόγες
Η Κίνα προχωρά στα δικά της σχέδια για την αποστολή ανθρώπων στη Σελήνη έως το 2030
Χρήστες εκφράζουν φόβους για τον ρόλο της τεχνητής νοημοσύνης στη μουσική
Ο επικεφαλής της OpenAI βλέπει πλέον τα πράγματα διαφορετικά
Η τεχνολογία εντυπωσιάζει, αλλά δημιουργεί ερωτήματα για την ασφάλεια και την εμπιστοσύνη
Η τεχνολογία θα προσφέρει τα εργαλεία, αλλά η ιατρική πιθανολογείται ότι θα παραμείνει, στην ουσία της, μια βαθιά ανθρώπινη επιστήμη.
Οι ευκαιρίες, οι κίνδυνοι και η ανάγκη για ρύθμιση
Νέα μελέτη συνδέει τα χέρια, τον εγκέφαλο και το περπάτημα
Ο επικεφαλής της εκδότριας εταιρείας έβαλε τέλος στα σενάρια που ήθελαν το πολυαναμενόμενο παιχνίδι να καθυστερεί ξανά
Ο Ντεξ Χάντερ-Τόρικ προειδοποίησε στην Αθήνα για το σοκ της τεχνητής νοημοσύνης στην εργασία
Έχετε δει 20 από 200 άρθρα.