Internet Archive: Οι τρελοί τύποι που αρχειοθετούν τα πάντα
«Ό,τι ανεβάζουμε στο διαδίκτυο μένει εκεί για πάντα» ακούμε συχνά ως προειδοποίηση προκειμένου να είμαστε προσεκτικοί
«Ό,τι ανεβάζουμε στο διαδίκτυο μένει εκεί για πάντα» ακούμε συχνά ως προειδοποίηση προκειμένου να είμαστε προσεκτικοί. Μεγάλη ευθύνη για αυτό το γεγονός έχει το Internet Archive. Το μακρινό 1996, όταν ακόμα το διαδίκτυο ήταν ένα παιχνίδι στα εργαστήρια των πανεπιστημίων, στο Σαν Φρανσίσκο προσπαθούσαν να λύσουν ένα δύσκολο πρόβλημα. Το ίντερνετ είχε μόλις δημιουργηθεί αλλά ήταν πολύ ζωντανό. Ιστοσελίδες ανέβαιναν, άλλαζαν και κατέβαιναν με γρήγορους ρυθμούς. Το διαδίκτυο σήμερα είναι τεράστιο και αλλάζει κάθε με καταιγιστικό ρυθμό. Υπάρχουν 1,8 δισεκατομμύρια ιστοσελίδες (τα 644 εκατομμύρια είναι ενεργές) και διπλασιάζεται σε μέγεθος κάθε 2 με 5 χρόνια. Η μέση ιστοσελίδα διαρκεί μόλις 100 ημέρες και τα περισσότερα άρθρα ξεχνιούνται 5 λεπτά μετά τη δημοσίευση. Χωρίς τη δημιουργία αντιγράφων όλα αυτά θα χάνονταν στο χρόνο.
Κάτι έπρεπε να γίνει για να μην χάνεται όλη αυτή η πληροφορία. Για αυτό τον σκοπό λοιπόν ο οραματιστής Brewster Kahle ίδρυσε το το 1996 το Internet Archive, μια μη κερδοσκοπική ψηφιακή βιβλιοθήκη. Ο σκοπός του Internet Archive ήταν να αρχειοθετεί οτιδήποτε έμπαινε στο διαδίκτυο προκειμένου να μη χάνεται ποτέ τίποτα. Στην αρχή χρησιμοποιούσε το λογισμικό του για να δημιουργεί αντίγραφα του διαδικτύου στη σοφίτα του. Το όραμα του όμως ήταν να προσφέρει «καθολική πρόσβαση σε όλες τις γνώσεις», να ξεπεράσει τη βιβλιοθήκη της Αλεξάνδρειας, τη μεγαλύτερη και σημαντικότερη βιβλιοθήκη της αρχαιότητας. Για περίπου 6 χρόνια υπομονετικά αρχειοθέτησε περισσότερες από 10 δισεκατομμύρια ιστοσελίδες αλλά το κοινό δεν είχε πρόσβαση σε αυτό τον θησαυρό. Αυτό μέχρι το 2001 όταν έκανε το ντεμπούτο του το Wayback Machine, ένα εργαλείο που επιτρέπει σε όλους μας να βλέπουμε το πολύτιμο αρχείο.
Σήμερα το Wayback Machine φιλοξενεί 349 δισεκατομμύρια ιστοσελίδες και η «μαμά» του, το Internet Archive, είναι η μεγαλύτερη βιβλιοθήκη του κόσμου. Η συλλογή του Internet Archive, δεν καλύπτει μόνο τον παγκόσμιο ιστό αλλά έχει και βιβλία, ηχογραφήσεις, βίντεο, εικόνες και λογισμικό. Το μέγεθος του ανέρχεται σε περισσότερα από 40 petabytes (αυτό είναι 40 εκατομμύρια gigabytes δεδομένων) και το Wayback Machine με τις ιστοσελίδες αποτελεί πάνω από το 60%. Αυτό αντιστοιχεί σε 80 εκατομμύρια ερμάρια 4 συρταριών γεμάτα χαρτί ή σε λίγο λιγότερο από το σύνολο όλων των γραπτών της ανθρωπότητας (σε όλες τις γλώσσες) από την αρχή της καταγεγραμμένης ιστορίας μέχρι σήμερα. Η Βιβλιοθήκη του Κογκρέσου των ΗΠΑ περιέχει περίπου 28 terabytes κειμένου - λιγότερο από το 0,1% του Internet Archive.
Και πως δουλεύει όλο αυτό το καταπληκτικό σύστημα αρχειοθέτησης; Μια στρατιά από 7.000 bots (προγράμματα που εκτελούν αυτοματοποιημένες εργασίες) σκανάρουν το διαδίκτυο δημιουργώντας αντίγραφα εκατομμυρίων ιστοσελίδων. Αυτά τα αντίγραφα, που ονομάζονται «στιγμιότυπα», δημιουργούνται με διαφορετικές συχνότητες (μερικές φορές πολλές φορές την ημέρα, άλλες φορές μία φορά κάθε λίγους μήνες ανάλογα με το πόσο συχνά αλλάζει το κάθε site) και μας δίνουν την εικόνα που έχει κάθε ιστότοπος σε μια συγκεκριμένη χρονική στιγμή. Για παράδειγμα, αν βάλουμε το site της AthensVoice στο Wayback Machine θα δούμε ότι έχει αρχειοθετηθεί περίπου 1.800 φορές από το 2003 μέχρι σήμερα. Αυτό δεν σημαίνει ότι έχει αλλάξει μόνο τόσες φορές αλλά ότι τόσες φορές επιλέχθηκε από τα ρομποτάκια του Internet Archive για να δημιουργηθεί στιγμιότυπο.
Κάτι που μας πάει στο επόμενο ερώτημα. Πως επιλέγονται αυτά που θα αρχειοθετηθούν; Δημιουργούμε αντίγραφα για ένα μεγάλο μέρος του διαδικτύου αλλά όχι για το σύνολο του, λένε οι υπεύθυνοι του Internet Archive. Απαιτεί συνεχή προσπάθεια για να βρεις ποια κομμάτια του internet είναι τα πιο χρήσιμα και να δώσεις την αντίστοιχη προτεραιότητα. Και επειδή πίσω από όλα είναι οι άνθρωποι, ο τεχνικός πίσω από τα bot πρέπει να αποφασίσει από πού ξεκινήσουν και πόσο βαθιά θα πηγαίνουν όταν δημιουργούν τα αντίγραφα. Είναι φανερό ότι όλη αυτή η διαδικασία απαιτεί τεράστιους τεχνικούς και ανθρώπινους πόρους. Τα χρήματα για όλα αυτά προέρχονται από επιχορηγήσεις, δωρεές αλλά και από τη συνδρομητική υπηρεσία αρχειοθέτησης Archive-It.
ΠΡΟΣΦΑΤΑ
ΤΑ ΠΙΟ ΔΗΜΟΦΙΛΗ
ΔΙΑΒΑΖΟΝΤΑΙ ΠΑΝΤΑ
ΔΕΙΤΕ ΕΠΙΣΗΣ
Στη μελέτη συμμετείχαν περισσότεροι από 15.000 ενήλικες
Μια συζήτηση με τον καθηγητή Φιλοσοφίας της Πληροφορικής και Ψηφιακού Ανθρωπισμού στο Ιόνιο Πανεπιστήμιο
Από τα video games στα εργαστήρια και η κληρονομιά που ενέπνευσε γενιές ερευνητών
Μια συζήτηση με τη Διευθύντρια Ερευνών στο Εθνικό Αστεροσκοπείο Αθηνών
Η οικονομική δημοκρατία στην πράξη ή «το εργαλείο των αναλφάβητων»
Αν, φυσικά, οι καιρικές συνθήκες το επιτρέψουν
Μυστηριώδη σύμβολα σε σπήλαια της Γερμανίας αποκαλύπτουν ένα άγνωστο σύστημα επικοινωνίας της Λίθινης Εποχής
Η νέα σειρά της Xiaomi ανεβάζει τον πήχη σε αντοχή, αυτονομία και εμπειρία χρήσης
Οι τάσεις που αντικατοπτρίζονται από τις λέξεις της χρονιάς της τελευταίας εικοσαετίας
Ειδικοί προειδοποιούν για πτώση δαπανών και μετατόπιση χρόνου σε social media, streaming και online στοιχηματισμό
Η βλάβη αναμένεται να επηρεάσει την εκτόξευση της ιστορικής επανδρωμένης αποστολής στη Σελήνη
Η παγκόσμια έλλειψη των τσιπ μνήμης απειλεί να μεταθέσει την κυκλοφορία του PS6, ενώ επηρεάζει ήδη Nintendo και Valve
Σε νέα βάση η συνεργασία των δύο κολοσσών - Στα 730 δισ. δολάρια εκτοξεύεται η αποτίμηση της δημιουργού του ChatGPT
Πολλοί άνθρωποι αναφέρουν ότι δυσκολεύονται πλέον να ολοκληρώσουν ένα βιβλίο
Τα συμπεράσματά έρευνας θα πρέπει να επιβεβαιωθούν όμως και από άλλες μελέτες
Από τον Γουίλιαμ Τζέιμς έως τη νευροεπιστήμη: Η συνείδηση ίσως απλώς παρακολουθεί τον νου
Νέο σύστημα Project Silica γράφει πληροφορίες σε γυαλί με λέιζερ και αντέχει χιλιετίες χωρίς συντήρηση
Η διαδικασία κατάργησης θα συνοδευτεί από σχετική ειδοποίηση εντός της εφαρμογής
Έχετε δει 20 από 200 άρθρα.