- CITY GUIDE
- PODCAST
-
23°
Πώς να εντοπίζετε κείμενα που γράφτηκαν με (εργαλεία) ΑΙ
Το αναγνωστικό κοινό απογοητεύεται, κόσμος μένει χωρίς δουλειά, αλλά είναι και η προδοσία ανάμεσα στον αναγνώστη και τον (όποιο) συντάκτη / συγγραφέα
Το να γράφεις κείμενα με Τεχνητή Νοημοσύνη εκτός από κοροϊδία, ε, είναι και μια μορφή βλακείας
Παλιά ήταν οι ghost writers, τώρα είναι το ΑΙ και τα εργαλεία του που ξερνούν λέξεις. Αυτά κι αν είναι γλωσσικά... φαντάσματα με φλύαρες, πολυγραφότατες «ψυχές». «Ψυχές» που μπορούν να γράψουν πεζογραφία, ποίηση, δημοσιογραφικά κείμενα και εταιρική αργκό. Και είναι τρομακτικά ευέλικτες: μπορούν να μιμηθούν τα σονέτα του Σαίξπηρ ή ένα φτηνό μυθιστόρημα παραλίας, τη λιτή και πυκνή πρόζα του Έρνεστ Χέμινγουεϊ ή ακόμη και το εγχειρίδιο χρήσης ενός εκτυπωτή γραφείου. Είναι επίσης αστραπιαία γρήγορες, παράγοντας χιλιάδες λέξεις το λεπτό. (Ο Χέμινγουεϊ σπάνια έγραφε τόσες σε μία ημέρα και χρειαζόταν πολύ περισσότερο αλκοόλ για να το πετύχει.) Οι επαγγελματίες της γραφής έχουν κάθε λόγο να ανησυχούν.
Γιατί τα κείμενα που παράγονται από εργαλεία ΑΙ βρίσκονται πλέον παντού. Είναι στα εισερχόμενα e-mail σας και στη ροή του LinkedIn. Έχουν κατακλύσει το διαδίκτυο, συντάσσοντας, σύμφωνα με μία εκτίμηση, περισσότερο από το ένα τρίτο των νέων ιστοσελίδων. Τα μεγάλα γλωσσικά μοντέλα (LLMs) βοηθούν τους φοιτητές να γράφουν εργασίες και πιθανότατα βοηθούν και τους επιστήμονες να συντάσσουν ακαδημαϊκές μελέτες. Μερικοί μάλιστα υποστήριξαν ότι ένα κείμενο γραμμένο από τεχνητή νοημοσύνη κέρδισε φέτος το Βραβείο Διηγήματος της Κοινοπολιτείας, με τους κριτές να επαινούν την «ήρεμη αυθεντία» του. (Το Ίδρυμα της Κοινοπολιτείας διέψευσε τον ισχυρισμό.)
Τα LLMs έχουν τις δικές τους στιλιστικές ιδιορρυθμίες. Κάνουν κατάχρηση συγκεκριμένων σημείων στίξεως (μεγάλες παύλες και άνω τελείες) και αγαπούν τη λέξη «μεγιστοποίηση» και τα παράγωγά της. Τους αρέσει να κάνουν «βαθιές καταδύσεις» σε θέματα ή, ακόμη καλύτερα, να «εμβαθύνουν», εξερευνώντας το «πλούσιο υφαντό» του κόσμου. Η γραφή της τεχνητής νοημοσύνης δεν προδίδεται από μία μόνο λέξη ή φράση, αλλά από ένα ολόκληρο σύνολο χαρακτηριστικών.
Ο εντοπισμός κειμένων που έχουν γραφτεί από τεχνητή νοημοσύνη μπορεί να αποδειχθεί δύσκολη υπόθεση. Εν μέρει επειδή χρειάζονται περισσότερες αποδείξεις από μερικές λέξεις ή παύλες: το να ισχυρίζεται κανείς ότι ένα κείμενο προέρχεται από LLM επειδή χρησιμοποιεί συγκεκριμένες λέξεις μοιάζει παρακινδυνευμένο.
Να από πού αντέγραψε η ΑΙ τις τεράστιες παρενθετικές παύλες!
Επιπλέον, τα bots δεν γράφουν όλα με τον ίδιο τρόπο. Δεν υπάρχει ένα ενιαίο ύφος τεχνητής νοημοσύνης, εξηγεί η γλωσσολόγος Καρολίνα Ρούντνιτσκα από το Πανεπιστήμιο του Γκντανσκ στην Πολωνία, όπως δεν υπάρχει και ένα ενιαίο ανθρώπινο ύφος γραφής. Οι συγγραφείς έχουν τις προσωπικές τους ιδιορρυθμίες. Η Έμιλι Ντίκινσον, για παράδειγμα, λάτρευε τις μεγάλες παύλες και το ίδιο ίσως κάνουν και τα bots.
Υπάρχουν, ωστόσο, ορισμένοι τρόποι για να αναγνωρίσει κανείς κείμενα που έχουν παραχθεί από LLM. Ένας από αυτούς είναι η χρήση αλγορίθμων ανίχνευσης, οι οποίοι έχουν εκπαιδευτεί να αναγνωρίζουν την «υφή» της ανθρώπινης και της τεχνητής γραφής. Η Pangram, μία από τις κορυφαίες εταιρείες του χώρου, ισχυρίζεται ότι επιτυγχάνει ακρίβεια 99,98%. (Η εταιρεία συνεργάζεται με την πλατφόρμα blogging Substack για την ανάπτυξη σχετικού εργαλείου). Ωστόσο, οι ανιχνευτές αυτοί λειτουργούν ως «μαύρα κουτιά» και συχνά παράγουν ψευδώς θετικά αποτελέσματα. Επιπλέον, δεν εξηγούν γιατί καταλήγουν στα συμπεράσματά στα οποία καταλήγουν.
Οι ερευνητές έχουν επίσης επιχειρήσει να εντοπίσουν ύποπτες λέξεις μέσα στα κείμενα ή να συγκρίνουν εργασίες που γράφτηκαν πριν και μετά τη δημόσια διάθεση των LLMs. Και αυτές όμως οι προσεγγίσεις έχουν μειονεκτήματα, κυρίως επειδή είναι δύσκολο να διαχωρίσει κανείς τις ιδιομορφίες της τεχνητής νοημοσύνης από τις ευρύτερες γλωσσικές τάσεις.
Τα χαρακτηριστικά γνωρίσματα της τεχνητής νοημοσύνης αποκαλύπτονται όταν συγκρίνει κανείς τη γραφή ανθρώπου και μηχανής. Για να γίνει αυτό, χρειάζεται ένα σημείο αναφοράς που να είναι ταυτόχρονα διακριτό και οικείο.
Το πείραμα του Economist με την Τεχνητή Νοημοσύνη
Το Economist στράφηκε σε κείμενα για τα οποία είναι βέβαιο ότι γράφτηκαν από ανθρώπους και τα οποία οι αναγνώστες αναγνωρίζουν αμέσως: τα δικά του. Σχεδίασε μια μελέτη ζητώντας από τα κορυφαία LLMs, το ChatGPT της OpenAI, το Claude της Anthropic, το Gemini της Google και το Grok της xAI, να ξαναγράψουν άρθρα του χωρίς να συμβουλευτούν το διαδίκτυο. Ως προτροπή χρησιμοποίησε τις περιλήψεις που παράγονται από τεχνητή νοημοσύνη και έχουν προστεθεί πειραματικά σε ορισμένα άρθρα του.
Έτσι δημιουργήθηκε ένα σώμα κειμένων αποτελούμενο τόσο από ανθρώπινα όσο και από τεχνητά δείγματα, το οποίο συγκρίθηκε σε 55.940 προτάσεις και 1,2 εκατομμύρια λέξεις. Για να διασφαλιστεί ότι εντοπίζονταν χαρακτηριστικά της τεχνητής νοημοσύνης και όχι του ίδιου του Economist, τα κείμενα αυτά συγκρίθηκαν επίσης με δημοσιογραφική ύλη από το CNN, τους New York Times και τη Washington Post. Πρόσθετο πεδίο ελέγχου αποτέλεσαν αποσπάσματα επιτυχημένων μυθιστορημάτων που εκδόθηκαν μεταξύ 1950 και 2022.
Τα ευρήματα ήταν απρόσμενα. Η γραφή της τεχνητής νοημοσύνης ξεχωρίζει τόσο από τις επιλογές λέξεων και σημείων στίξης όσο και από τη δομή των προτάσεων και των παραγράφων. Ωστόσο, τα χαρακτηριστικά της δεν είναι αυτά που θα περίμενε κανείς, εν μέρει επειδή το ύφος της έχει αλλάξει με τις διαδοχικές αναβαθμίσεις του λογισμικού. Αυτό δεν σημαίνει ότι τα LLMs είναι σπουδαίοι συγγραφείς: η πρόζα τους συχνά στερείται διαύγειας και κομψότητας και καταλήγει να ακολουθεί επαναλαμβανόμενα μοτίβα. Όσοι, λοιπόν, φιλοδοξούν να γίνουν εντυπωσιακοί αφηγητές καλό θα ήταν να αποφεύγουν τις παρακάτω ιδιομορφίες στη δική τους γραφή.
Ας δούμε πρώτα τις λέξεις. Το λεξιλόγιο που χρησιμοποιούν υπερβολικά τα bots έχει αλλάξει: δεν «εμβαθύνουν» πλέον τόσο συχνά σε θέματα, ούτε εμφανίζονται παντού τα περίφημα «υφαντά» (tapestries). Στη θέση τους συναντά κανείς πληθώρα πολυσύλλαβων λέξεων όπως «σημαντικός» (significant), «ολοένα και περισσότερο» (increasingly) και «συνέπειες» (consequences). Τα μοντέλα χρησιμοποιούν συχνότερα από τους ανθρώπους σπάνιες λέξεις, όπως «αλληλεξάρτηση» (interdependence) και «επαναβιομηχάνιση» (reindustrialisation), καθώς και επιστημονική ορολογία, όπως «παράμετρος» (parameter) και «μεθοδολογία» (methodology). Έχουν επίσης ιδιαίτερη αδυναμία στη μετατροπή ρημάτων σε ουσιαστικά, όπως το expansion από το expand. Όλα τα LLMs που εξετάστηκαν στη μελέτη παρουσιάζουν αυτή την τάση, ιδιαίτερα όμως τα Gemini και Claude.
Μεγάλο μέρος αυτού του λεξιλογίου θα μπορούσε να χαρακτηριστεί ως αυτό που ο Τζορτζ Όργουελ αποκαλούσε «πομπώδης λεξιλογία» (pretentious diction). Ο Όργουελ καταφερόταν εναντίον συγγραφέων που «ντύνουν απλές διαπιστώσεις» με περίπλοκες λέξεις και ορολογία για να φαίνονται πιο έξυπνοι. Όπως παρατηρούσε, αυτοί οι ρητορικοί επιδειξιομανείς πιστεύουν επίσης ότι οι λέξεις λατινικής ή ελληνικής προέλευσης είναι πιο επιβλητικές από τις γερμανικής καταγωγής αγγλικές λέξεις. (Τα bots φαίνεται να συμφωνούν: στα κείμενά τους εμφανίζονται συχνότερα λατινογενείς καταλήξεις από ό,τι στα κείμενα που έχουν γραφτεί από ανθρώπινο χέρι).
Έπειτα, κοιτάξτε τη στίξη. Πολλοί πιστεύουν ότι τα LLMs γεμίζουν τα κείμενά τους με μεγάλες παύλες, όμως αυτό δεν ισχύει πλέον μετά τις πιο πρόσφατες αναβαθμίσεις. Σήμερα μόνο το Claude χρησιμοποιεί περισσότερες μεγάλες παύλες από τους ανθρώπους - συγγραφείς, ενώ το ChatGPT χρησιμοποιεί αισθητά λιγότερες από οποιονδήποτε άλλο «συγγραφέα» της έρευνας. Οι άνθρωποι μπορούν λοιπόν να αναθαρρήσουν και να αρχίσουν ξανά να χρησιμοποιούν παύλες χωρίς τύψεις.
Ένας καλύτερος τρόπος να εντοπίσει κανείς κείμενα που έχουν παραχθεί από τεχνητή νοημοσύνη ίσως είναι να αναζητήσει κείμενα με ελάχιστη στίξη συνολικά. Τα LLMs είναι εντυπωσιακά «τζοϋσικά» σε αυτό το σημείο, κοινώς χρησιμοποιούν λιγότερα κόμματα και άνω τελείες από τους ανθρώπους, ενώ σχεδόν αποφεύγουν τις παρενθέσεις. Η περιορισμένη χρήση σημείων στίξης οφείλεται εν μέρει στο ότι γράφουν μεγαλύτερες προτάσεις, με τη λέξη «και» (and) να είναι η πλέον υπερχρησιμοποιημένη. Οφείλεται όμως και στο γεγονός ότι σπάνια παραθέτουν δηλώσεις ή γνώμες ειδικών.
Τα bots γράφουν φλύαρα και κάπως... χαζούτσικα
Τέλος, εξετάστε την πρόταση. Οι προτάσεις των bots τείνουν να είναι μεγάλες και οι παράγραφοι σπάνια διακόπτονται από σύντομες, κοφτές διατυπώσεις. Πόσο βαρετό. Όταν τα LLMs θέλουν να δώσουν περισσότερη ζωντάνια στις προτάσεις τους, καταφεύγουν συχνά σε ρητορικά σχήματα. Στα αγαπημένα τους συγκαταλέγονται οι κατασκευές «όχι το Χ αλλά το Υ», «όχι μόνο... αλλά και...» και ο λεγόμενος «κανόνας του τρία». (Η ομαδοποίηση ιδεών σε τριάδες τις κάνει πιο ελκυστικές, όπως μόλις κάναμε.) Το ChatGPT και το Claude χρησιμοποιούν τέτοιες δομές συχνότερα, ανά 1.000 προτάσεις, από ό,τι τα άλλα LLMs αλλά και οι άνθρωποι συγγραφείς.
Έτσι, αν θέλετε να εντοπίσετε κείμενα γραμμένα από τεχνητή νοημοσύνη, αναζητήστε προς το παρόν μια πεζογραφία άχρωμη και πομπώδη, φορτωμένη με λατινογενείς λέξεις. Το πρόβλημα είναι ότι, όπως δείχνει η μελέτη, με κάθε νέα αναβάθμιση η γραφή της τεχνητής νοημοσύνης μοιάζει όλο και περισσότερο με την ανθρώπινη. Η Pangram κατάφερε να αναγνωρίσει επιτυχώς κείμενα παραγόμενα από AI, αλλά στο μέλλον ενδέχεται να δυσκολευτεί περισσότερο. Τα LLMs εκπαιδεύονται πάνω σε ανθρώπινα κείμενα και βελτιώνονται μέσω ανθρώπινης ανατροφοδότησης, παρατηρεί ο Τόμι Τζούζεκ του Πανεπιστημίου της Πολιτείας της Φλόριντα. Έτσι, υιοθετούν όσα οι άνθρωποι θεωρούν εντυπωσιακά και εγκαταλείπουν εκείνα που δεν τους αρέσουν.
Τα bots, άλλωστε, μαθαίνουν γρήγορα. Πάρτε ως παράδειγμα το ChatGPT. Μέχρι πολύ πρόσφατα χρησιμοποιούσε μεγάλη παύλα σχεδόν σε κάθε πρόταση. Όταν ο συντάκτης του άρθρου ρώτησε μια παλαιότερη έκδοση αν θεωρεί ότι η τεχνητή νοημοσύνη κάνει κατάχρηση της παύλας, εκείνη απάντησε: «Χα, εξαιρετική ερώτηση!». Αν θέσετε σήμερα την ίδια ερώτηση στο bot, η απάντηση είναι πολύ πιο συγκρατημένη: «Καλό είναι να χρησιμοποιούνται με φειδώ». Μόνο ένα φάντασμα θα μπορούσε να αλλάζει μορφή –και μεθοδολογία δράσης– τόσο γρήγορα!
ΠΗΓΗ: The Economist
ΤΑ ΠΙΟ ΔΗΜΟΦΙΛΗ
ΔΙΑΒΑΖΟΝΤΑΙ ΠΑΝΤΑ
ΔΕΙΤΕ ΕΠΙΣΗΣ
Το αναγνωστικό κοινό απογοητεύεται, κόσμος μένει χωρίς δουλειά, αλλά είναι και η προδοσία ανάμεσα στον αναγνώστη και τον (όποιο) συντάκτη / συγγραφέα
Η παγίδα που πρέπει να γνωρίζουν οι γονείς και πώς να την αποφύγουν
Ο ερευνητής του «Δημόκριτου» Στέλιος Καρόζης εξηγεί στην ATHENS VOICE τι είναι –και τι δεν είναι– το AI Factory «Pharos»
Τα δεδομένα μέχρι σήμερα δεν δείχνουν αυξημένο κίνδυνο
Ο πρόεδρος του ΕΚΕΦΕ «Δημόκριτος», Βαγγέλης Καρκαλέτσης, μιλά στην ATHENS VOICE για το μεγάλο στοίχημα του Quantum, την ΑΙ που αρχίζει να τον ανησυχεί και την επιστροφή Ελλήνων επιστημόνων
Η ΤΝ δεν αλλάζει μόνο τον τρόπο με τον οποίο εργαζόμαστε. Μπορεί να αλλάξει και τον τρόπο με τον οποίο ένας άνθρωπος ξεχωρίζει στη δουλειά του.
Μια βραδιά επιστήμης, δέους και μεγάλων ερωτημάτων για τη θέση μας στο σύμπαν
Το νέο AI της Meta αναδεικνύει νικητές και χαμένους
Έρευνα αποκαλύπτει τη ραγδαία αύξηση της ψηφιακής εξάρτησης των νέων
Περισσότεροι από 180 ομιλητές από 60 χώρες θα βρεθούν στις σκηνές του συνεδρίου στο Άμπου Ντάμπι, στις 6-7 Οκτωβρίου
Έρευνα-ανατροπή στην ιατρική - Ελπίδα για θεραπείες θανατηφόρων παθήσεων που σχετίζονται με τον εγκέφαλο
Μιλήσαμε με την Μαίρη Πατρικίου για την πλατφόρμα που καλεί τους αγνώστους της διπλανής πόρτας να γίνουν γείτονες
100 χρόνια από το έτος που αναδιαμόρφωσε την επιστημονική σκέψη
Ο καβγάς για τις «πειραγμένες» οικογενειακές φωτογραφίες με τα εγγόνια
Γιατί η απόδοση ενός λογοτεχνικού έργου απαιτεί ερμηνεία, δημιουργικότητα και βαθιά σχέση με τη γλώσσα
Τα εργαλεία γεννούν καινούργιες ερωτήσεις
Το ψηφιακό άβαταρ μπέρδεψε τα λόγια του κατά τη διάρκεια τηλεοπτικής συνέντευξης
Ο επικεφαλής της Nvidia απορρίπτει τα σενάρια αφανισμού - «Δεν βασίζονται στην επιστήμη»
Τι σημαίνει ο αριθμός που βλέπετε στο ρολόι σας
Έχετε δει 20 από 200 άρθρα.