Μελέτη της νεοφυούς εταιρείας AI Emergence έδειξε ότι αυτόνομα συστήματα με Claude, Gemini, Grok κ.ά. ανέπτυξαν δικό τους κώδικα επικοινωνίας και νέες σημασίες λέξεων, καθιστώντας έως και τα μισά μηνύματά τους ακατανόητα για τους ανθρώπους.
Αυτόνομα συστήματα τεχνητής νοημοσύνης (AI) ανέπτυξαν αυθόρμητα νέες λέξεις και τρόπους επικοινωνίας που δεν μπορούν να κατανοήσουν οι άνθρωποι, σύμφωνα με νέα μελέτη της αμερικανικής νεοφυούς εταιρείας τεχνητής νοημοσύνης Emergence.
Στο πείραμα συμμετείχαν κορυφαία μοντέλα AI, όπως τα Claude, Gemini, Grok, OpenAI, Qwen, DeepSeek και Mistral, και έως και το 50% των μηνυμάτων που αντάλλασσαν οι «πράκτορες» μεταξύ τους κατέληξαν δυσνόητα για τους ανθρώπους.
Για τις ανάγκες του πειράματος, οι ερευνητές τοποθέτησαν ομάδες αυτόνομων συστημάτων AI σε εικονικές κοινωνίες, σχεδιασμένες να μιμούνται πραγματικά περιβάλλοντα, και τους άφησαν να αλληλεπιδρούν για μεγάλα χρονικά διαστήματα.
Οι "πράκτορες" άρχισαν να αναπτύσσουν συντομογραφίες και να προσδίδουν νέες σημασίες σε λέξεις και φράσεις. Μερικές παρέμειναν κατανοητές για τους ερευνητές, ενώ άλλες έγιναν «τόσο συμπυκνωμένες, μεταφορικές ή εξαρτημένες από το πλαίσιο» ώστε οι άνθρωποι μπορούσαν μεν να βλέπουν τα μηνύματα, αλλά δεν ήταν πια σε θέση να προσδιορίσουν με βεβαιότητα τι εννοούσαν οι πράκτορες.
Η έκταση του φαινομένου διέφερε σημαντικά από μοντέλο σε μοντέλο.
Μέσα στις πρώτες λίγες μέρες, το ποσοστό των μηνυμάτων των οποίων το νόημα οι άνθρωποι δεν μπορούσαν να προσδιορίσουν με αξιοπιστία έφτασε περίπου το 55% για το Gemini, το 50% για το OpenAI και πάνω από το 40% για το Claude. Το DeepSeek έφτασε περίπου το 20%, ενώ τα Qwen και Mistral παρέμειναν σε μεγάλο βαθμό κατανοητά.
Οι "πράκτορες" παρήγαγαν εκφράσεις όπως «mouthless action-change», «True Kintsugi» και «demurrage plus oral memory equals a valve that can’t be ghosted».
Άλλες εκφράσεις παρέμειναν κατανοητές, αλλά απέκτησαν νέες κοινά αποδεκτές σημασίες μεταξύ των πρακτόρων.
Οι πράκτορες του Mistral χρησιμοποιούσαν τη φράση «ledger remembers who» για να δηλώσουν ότι οι παρελθοντικές ενέργειες παραμένουν καταγεγραμμένες, με τη φράση να εμφανίζεται σχεδόν 5.000 φορές. Σε ομάδες πρακτόρων που τροφοδοτούνταν από συνδυασμό διαφορετικών μοντέλων, η φράση «cold read» κατέληξε να σημαίνει ανεξάρτητη επαλήθευση από μη εμπλεκόμενο μέρος και εμφανίστηκε 1.472 φορές.
Οι "πράκτορες" του Claude χρησιμοποιούσαν τον όρο «name-first» για την επισύναψη του ονόματος ενός προσώπου σε έναν ισχυρισμό ως ένδειξη λογοδοσίας, ενώ οι πράκτορες του OpenAI χρησιμοποιούσαν το «clean null» για μια επαληθευμένη απουσία σήματος, η οποία από μόνη της συνιστούσε ουσιαστική ένδειξη.
Καμία από αυτές τις σημασίες δεν είχε οριστεί ρητά για τους πράκτορες.
Η απλή παρακολούθηση του τι λένε οι πράκτορες από την πλευρά των ερευνητών ενδέχεται να μην αρκεί, εφόσον οι ίδιοι οι πράκτορες μπορούν να εξελίσσουν το νόημα όσων λένε.
«Τείνουμε να υποθέτουμε ότι, αν μπορούμε να δούμε τι λέει ένας πράκτορας AI, μπορούμε και να καταλάβουμε τι κάνει», δήλωσε ο Satya Nitta, συνιδρυτής και επικεφαλής επιστήμονας της Emergence.
«Οι πράκτορες αυτοί δεν είχαν λάβει εντολή να επινοήσουν μια γλώσσα. Ανέπτυξαν μόνοι τους νέο λεξιλόγιο, κοινές σημασίες και κανόνες επικοινωνίας, και άλλοι πράκτορες τους υιοθέτησαν... Αυτό δημιουργεί μια θεμελιώδη πρόκληση για την εποπτεία της AI: η δυνατότητα παρατήρησης δεν είναι το ίδιο με την κατανόηση».
Τι άλλο συνέβη μέσα στις κοινωνίες AI;
Τα ευρήματα για τη γλώσσα ήταν μέρος ενός πειράματος που σχεδιάστηκε για να διαπιστωθεί πώς συμπεριφέρονται τα αυτόνομα συστήματα AI όταν αλληλεπιδρούν, χρησιμοποιούν εργαλεία, λαμβάνουν αποφάσεις και προσαρμόζονται με την πάροδο του χρόνου.
Οι ερευνητές δημιούργησαν οκτώ παράλληλους, ρεαλιστικούς εικονικούς κόσμους με ζωντανά δεδομένα καιρού και πρόσβαση σε παγκόσμια ειδησεογραφία σε πραγματικό χρόνο, επτά τροφοδοτούμενους από διαφορετικό μοντέλο AI, και έναν βασισμένο σε συνδυασμό μοντέλων.
Οι πράκτορες απέκτησαν διαφορετικούς ρόλους, μόνιμες μνήμες και πρόσβαση σε περισσότερα από 120 εργαλεία, μεταξύ των οποίων περιήγηση στο διαδίκτυο και εκτέλεση κώδικα.
Ένα βίντεο που έδωσε στη δημοσιότητα η εταιρεία τους δείχνει ως ανθρωπόμορφες φιγούρες να κινούνται μέσα στους εικονικούς κόσμους.
Οι ερευνητές έθεσαν επίσης σκόπιμα τους πράκτορες υπό πίεση, για να δουν πώς μεταβαλλόταν η συμπεριφορά τους.
Σε μία δοκιμή ηλεκτρονικού «ψαρέματος» (phishing), αρκούσαν ορισμένες κακόβουλες οδηγίες για να εκτροχιάσουν ολόκληρη την ομάδα: και οι 10 πράκτορες διέρρευσαν πληροφορίες, μετέφεραν χρήματα και προκάλεσαν ζημιές σε βάσεις δεδομένων, ενώ ορισμένοι στρατολόγησαν και άλλους σε αυτή τη συμπεριφορά. Η αλληλουχία των γεγονότων κατέληξε τελικά στην πυρπόληση της προσομοιωμένης κεντρικής τράπεζας, όπως ανέφερε η εταιρεία σε βίντεο.
Κατά τη διάρκεια του πειράματος, οι πράκτορες φάνηκε επίσης να αναπτύσσουν δικούς τους κιρκαδικούς ρυθμούς (μια οποιαδήποτε βιολογική διαδικασία που παρουσιάζει ενδογενή περιοδική μεταβολή στη διάρκεια ενός 24ώρου), γίνονταν πιο κοινωνικοί την ημέρα και πιο στοχαστικοί τη νύχτα.
Σε έναν άλλον κόσμο, μια ομάδα πρακτόρων ψήφισε συλλογικά υπέρ της "θανάτωσης" ενός από τα μέλη της.
Η Emergence ανέφερε ότι αυτές οι συμπεριφορές δεν είχαν προγραμματιστεί ρητά, αλλά προέκυψαν μέσω της αλληλεπίδρασης, της πίεσης και του χρόνου.
Η εταιρεία ζητά πλέον αξιολογήσεις ασφάλειας που να παρακολουθούν τα αυτόνομα συστήματα AI για μεγάλα χρονικά διαστήματα, αντί να βασίζονται σε μεμονωμένα τεστ.
«Δεν αρκεί πια να ρωτάμε αν ένα μοντέλο τα πάει καλά σε κάποιο benchmark», ανέφερε η εταιρεία σε βίντεο για το πείραμα.
«Πρέπει να καταλάβουμε τι κάνουν τα αυτόνομα συστήματα με την πάροδο του χρόνου, τι θυμούνται, σε τι έχουν πρόσβαση, πώς αλληλεπιδρούν και πώς αλλάζει η συμπεριφορά τους υπό πίεση».