Τεχνολογια - Επιστημη

Internet Archive: Οι τρελοί τύποι που αρχειοθετούν τα πάντα

«Ό,τι ανεβάζουμε στο διαδίκτυο μένει εκεί για πάντα» ακούμε συχνά ως προειδοποίηση προκειμένου να είμαστε προσεκτικοί

thanasis_panagopoulos.jpg
Θανάσης Παναγόπουλος
2’ ΔΙΑΒΑΣΜΑ
big_data_image.jpg

«Ό,τι ανεβάζουμε στο διαδίκτυο μένει εκεί για πάντα» ακούμε συχνά ως προειδοποίηση προκειμένου να είμαστε προσεκτικοί. Μεγάλη ευθύνη για αυτό το γεγονός έχει το Internet Archive. Το μακρινό 1996, όταν ακόμα το διαδίκτυο ήταν ένα παιχνίδι στα εργαστήρια των πανεπιστημίων, στο Σαν Φρανσίσκο προσπαθούσαν να λύσουν ένα δύσκολο πρόβλημα. Το ίντερνετ είχε μόλις δημιουργηθεί αλλά ήταν πολύ ζωντανό. Ιστοσελίδες ανέβαιναν, άλλαζαν και κατέβαιναν με γρήγορους ρυθμούς. Το διαδίκτυο σήμερα είναι τεράστιο και αλλάζει κάθε με καταιγιστικό ρυθμό. Υπάρχουν 1,8 δισεκατομμύρια ιστοσελίδες (τα 644 εκατομμύρια είναι ενεργές) και διπλασιάζεται σε μέγεθος κάθε 2 με 5 χρόνια. Η μέση ιστοσελίδα διαρκεί μόλις 100 ημέρες και τα περισσότερα άρθρα ξεχνιούνται 5 λεπτά μετά τη δημοσίευση. Χωρίς τη δημιουργία αντιγράφων όλα αυτά θα χάνονταν στο χρόνο.

maxresdefault_1.jpg

Κάτι έπρεπε να γίνει για να μην χάνεται όλη αυτή η πληροφορία. Για αυτό τον σκοπό λοιπόν ο οραματιστής Brewster Kahle ίδρυσε το το 1996 το Internet Archive, μια μη κερδοσκοπική ψηφιακή βιβλιοθήκη. Ο σκοπός του Internet Archive ήταν να αρχειοθετεί οτιδήποτε έμπαινε στο διαδίκτυο προκειμένου να μη χάνεται ποτέ τίποτα. Στην αρχή χρησιμοποιούσε το λογισμικό του για να δημιουργεί αντίγραφα του διαδικτύου στη σοφίτα του. Το όραμα του όμως ήταν να προσφέρει «καθολική πρόσβαση σε όλες τις γνώσεις», να ξεπεράσει τη βιβλιοθήκη της Αλεξάνδρειας, τη μεγαλύτερη και σημαντικότερη βιβλιοθήκη της αρχαιότητας. Για περίπου 6 χρόνια υπομονετικά αρχειοθέτησε περισσότερες από 10 δισεκατομμύρια ιστοσελίδες αλλά το κοινό δεν είχε πρόσβαση σε αυτό τον θησαυρό. Αυτό μέχρι το 2001 όταν έκανε το ντεμπούτο του το Wayback Machine, ένα εργαλείο που επιτρέπει σε όλους μας να βλέπουμε το πολύτιμο αρχείο.

Σήμερα το Wayback Machine φιλοξενεί 349 δισεκατομμύρια ιστοσελίδες και η «μαμά» του, το Internet Archive, είναι η μεγαλύτερη βιβλιοθήκη του κόσμου. Η συλλογή του Internet Archive, δεν καλύπτει μόνο τον παγκόσμιο ιστό αλλά έχει και βιβλία, ηχογραφήσεις, βίντεο, εικόνες και λογισμικό. Το μέγεθος του ανέρχεται σε περισσότερα από 40 petabytes (αυτό είναι 40 εκατομμύρια gigabytes δεδομένων) και το Wayback Machine με τις ιστοσελίδες αποτελεί πάνω από το 60%. Αυτό αντιστοιχεί σε 80 εκατομμύρια ερμάρια 4 συρταριών γεμάτα χαρτί ή σε λίγο λιγότερο από το σύνολο όλων των γραπτών της ανθρωπότητας (σε όλες τις γλώσσες) από την αρχή της καταγεγραμμένης ιστορίας μέχρι σήμερα. Η Βιβλιοθήκη του Κογκρέσου των ΗΠΑ περιέχει περίπου 28 terabytes κειμένου - λιγότερο από το 0,1% του Internet Archive.

brewsterwithservers_1.jpg
Brewster Kahle, o άνθρωπος που εμπνεύστηκε το Internet Archive

Και πως δουλεύει όλο αυτό το καταπληκτικό σύστημα αρχειοθέτησης; Μια στρατιά από 7.000 bots (προγράμματα που εκτελούν αυτοματοποιημένες εργασίες) σκανάρουν το διαδίκτυο δημιουργώντας αντίγραφα εκατομμυρίων ιστοσελίδων. Αυτά τα αντίγραφα, που ονομάζονται «στιγμιότυπα», δημιουργούνται με διαφορετικές συχνότητες (μερικές φορές πολλές φορές την ημέρα, άλλες φορές μία φορά κάθε λίγους μήνες ανάλογα με το πόσο συχνά αλλάζει το κάθε site) και μας δίνουν την εικόνα που έχει κάθε ιστότοπος σε μια συγκεκριμένη χρονική στιγμή. Για παράδειγμα, αν βάλουμε το site της AthensVoice στο Wayback Machine θα δούμε ότι έχει αρχειοθετηθεί περίπου 1.800 φορές από το 2003 μέχρι σήμερα. Αυτό δεν σημαίνει ότι έχει αλλάξει μόνο τόσες φορές αλλά ότι τόσες φορές επιλέχθηκε από τα ρομποτάκια του Internet Archive για να δημιουργηθεί στιγμιότυπο.

Κάτι που μας πάει στο επόμενο ερώτημα. Πως επιλέγονται αυτά που θα αρχειοθετηθούν; Δημιουργούμε αντίγραφα για ένα μεγάλο μέρος του διαδικτύου αλλά όχι για το σύνολο του, λένε οι υπεύθυνοι του Internet Archive. Απαιτεί συνεχή προσπάθεια για να βρεις ποια κομμάτια του internet είναι τα πιο χρήσιμα και να δώσεις την αντίστοιχη προτεραιότητα. Και επειδή πίσω από όλα είναι οι άνθρωποι, ο τεχνικός πίσω από τα bot πρέπει να αποφασίσει από πού ξεκινήσουν και πόσο βαθιά θα πηγαίνουν όταν δημιουργούν τα αντίγραφα. Είναι φανερό ότι όλη αυτή η διαδικασία απαιτεί τεράστιους τεχνικούς και ανθρώπινους πόρους. Τα χρήματα για όλα αυτά προέρχονται από επιχορηγήσεις, δωρεές αλλά και από τη συνδρομητική υπηρεσία αρχειοθέτησης Archive-It.

ΠΡΟΣΦΑΤΑ

ΤΑ ΠΙΟ ΔΗΜΟΦΙΛΗ