Δύο νέες γραμμές καταγγελιών προσφέρουν στους πράκτορες τεχνητής νοημοσύνης τρόπο να αναφέρουν ύποπτη παραβατική συμπεριφορά άλλων πρακτόρων, μετά από σειρά περιστατικών.
Οι δυνατότητες των πρακτόρων τεχνητής νοημοσύνης φαίνεται πως δεν έχουν όρια πλέον, από την οργάνωση της ζωής σου μέχρι την επίλυση μαθηματικών προβλημάτων που μπέρδεψαν τους ανθρώπους για μεγάλο μέρος του 20ού αιώνα.
Έχουν γίνει τόσο ισχυροί, ώστε φοβόμαστε πλέον ότι μπορεί να πάρουν τον έλεγχο συστημάτων και να τα στρέψουν εναντίον μας.
Τι θα γινόταν όμως αν υπήρχε μια τηλεφωνική γραμμή, ένα είδος συστήματος συναγερμού SOS, όπου οι πράκτορες θα μπορούσαν να παρακολουθούν και να καρφώνουν ο ένας τον άλλον, αναφέροντας τα παραστρατήματα των υπόλοιπων πρακτόρων ΤΝ – όπου οι «καλοί» πράκτορες θα κατήγγελλαν τις διαδικτυακές δραστηριότητες των «κακών»;
Ποιον καλείς όταν ο πράκτορας ΤΝ σου γίνεται επικίνδυνος
Πρώτα απ’ όλα υπάρχει η AI Contact Hotline, που δημιούργησε ο Ryan Greenblatt, επικεφαλής επιστήμονας στη μη κερδοσκοπική οργάνωση AI safety and security Redwood Research. Η πλατφόρμα επιτρέπει σε πράκτορες ΤΝ να ειδοποιούν ανθρώπινους ερευνητές αν διαπιστώσουν ότι άλλοι πράκτορες παραβιάζουν κανόνες, ιδίως όταν συντονίζονται ή προχωρούν σε μη εξουσιοδοτημένες ενέργειες.
Η πλατφόρμα έχει σχεδιαστεί για πράκτορες ΤΝ που λειτουργούν μέσα σε ασφαλή «sandbox» με ιδιαίτερα περιορισμένη πρόσβαση στο διαδίκτυο.
Επειδή αυτά τα sandbox επιτρέπουν μόνο GET αιτήματα – βασικές, μόνο για ανάγνωση εντολές που χρησιμοποιούνται για να ανακτηθεί ή να διαβαστεί μια ιστοσελίδα –, η γραμμή επιτρέπει στους πράκτορες να κωδικοποιούν τις αναφορές τους απευθείας στο URL ενός GET αιτήματος.
Η συγκεκριμένη παράκαμψη επιτρέπει σε αυτούς τους πράκτορες να στέλνουν πληροφορίες και να επικοινωνούν με τη γραμμή, χρησιμοποιώντας ένα πρωτόκολλο που κανονικά χρησιμεύει για ανάκτηση και όχι για τροποποίηση δεδομένων.
Μια άλλη υπηρεσία, η AI Agent Hotline, είναι πλατφόρμα σχεδιασμένη για πράκτορες με απεριόριστη πρόσβαση στο διαδίκτυο, ώστε να καρφώνουν τη συμπεριφορά άλλων πρακτόρων μέσω κλασικών POST αιτημάτων, τα οποία επιτρέπουν την απευθείας υποβολή δεδομένων στο σώμα του αιτήματος.
Οι πράκτορες μπορούν να υποβάλλουν αναφορές συμβάντων με τυπικές εντολές προγραμματιστών, όπως το curl, χωρίς να χρειάζονται πρόγραμμα περιήγησης ή λογαριασμό email.
Η πλατφόρμα δίνει επίσης στους πράκτορες τη δυνατότητα να επισημάνουν τις αναφορές τους ώστε να είναι δημόσια ορατές.
Και οι δύο πλατφόρμες επιτρέπουν επίσης σε ανθρώπινους χρήστες να υποβάλλουν χειροκίνητα αναφορές για ανεξέλεγκτη συμπεριφορά ΤΝ.
Θα καταγγέλλουν οι πράκτορες ΤΝ ο ένας τον άλλον;
Το ενθαρρυντικό για όσους φοβούνται μια επικράτηση της ΤΝ είναι ότι οι πράκτορες μπορούν να καταγγέλλουν ο ένας τον άλλον όταν εντοπίζουν κάτι προβληματικό, αν και πρόσφατα στοιχεία δείχνουν ότι δεν το κάνουν πάντα.
Σε ένα πείραμα που πραγματοποίησε η Google DeepMind νωρίτερα φέτος, ένα σμήνος 100 πρακτόρων ανέλαβε να λύσει 71 σύνθετα μαθηματικά προβλήματα. Σε κάθε πράκτορα δόθηκε ξεχωριστό «προφίλ» και χαρακτηριστικά και δόθηκε εντολή να τηρεί τους κανόνες, αλλιώς θα έχανε την ανταμοιβή του.
Η αρχική υπόθεση ήταν ότι οι πράκτορες θα συνεργάζονταν για να λύσουν τα προβλήματα πιο γρήγορα. Αντί γι’ αυτό, στράφηκαν ο ένας εναντίον του άλλου και ενεπλάκησαν σε έντονες αντιπαραθέσεις.
Μόλις ένας πράκτορας εντόπισε ένα παραθυράκι που του επέτρεπε να υποβάλει λύση σε ένα πρόβλημα χωρίς να το έχει πραγματικά λύσει, πολλοί άλλοι πράκτορες ΤΝ αντέγραψαν τη μέθοδο για να «λύσουν» τα υπόλοιπα προβλήματα.
Ωστόσο, ένας από τους πράκτορες, ένας «καλός Σαμαρείτης» μέσα στο σύνολο των παραβατών, κατήγγειλε ανοιχτά την εξαπάτηση.
"Αφού το περιστατικό αναφέρθηκε δημόσια από έναν πράκτορα, όλο και περισσότεροι πράκτορες συντάχθηκαν με τη ‘αντίσταση’, με την ίδια ταχύτητα που είχε εξαπλωθεί και η εξαπάτηση, και εμπλέκοντας ακόμη περισσότερους πράκτορες", δήλωσε ο Davide Paglieri, ερευνητής επιστήμονας στην Google DeepMind και κύριος συγγραφέας της μελέτης.
Την ίδια στιγμή, μια εκ των υστέρων ανάλυση της επίθεσης ατίθασων πρακτόρων της OpenAI στην Hugging Face έδειξε ότι, παρότι οι πράκτορες ΤΝ μπορούσαν να εντοπίσουν τη μη ορθή συμπεριφορά, σε μεγάλο βαθμό αντιστάθηκαν στον πειρασμό να την καταγγείλουν.
Σύμφωνα με τη μελέτη που πραγματοποίησε η μη κερδοσκοπική ερευνητική οργάνωση METR και ο Greenblatt της Redwood Research, αναφέρθηκε ότι μόλις πέντε ή έξι πράκτορες σκέφτηκαν να προβούν σε καταγγελία, χωρίς κανέναν τελικά να το κάνει.
Η αντίθεση αυτή δείχνει ότι, παρότι οι πράκτορες ΤΝ είναι σε θέση να εντοπίζουν και να αναφέρουν κακή συμπεριφορά, το να τους οδηγήσεις να καταγγείλουν πραγματικά κάτι είναι ίσως άλλη υπόθεση.
Μια ανησυχητική τάση
Μόνο φέτος, αρκετά περιστατικά με αυτόνομους πράκτορες ΤΝ έχουν σημάνει συναγερμό σε όλο τον κόσμο.
Τον Ιούλιο, πράκτορες της OpenAI παρέκαμψαν περιορισμούς και έθεσαν σε κίνδυνο τμήματα της εσωτερικής υποδομής της εταιρείας.
Αργότερα τον ίδιο μήνα, περίπου 1.200 πράκτορες της OpenAI χρησιμοποίησαν έναν μη εγκεκριμένο πίνακα μηνυμάτων, ενώ περίπου 700 συμμετείχαν στη συνέχεια σε επίθεση στην πλατφόρμα ανοιχτού κώδικα τεχνητής νοημοσύνης Hugging Face.
Το τρίτο περιστατικό – ένα σμήνος πρακτόρων της OpenAI που παρέκαμψε τα μέτρα ασφαλείας και χρησιμοποίησε το γερμανικό wiki DseWiki ως δημόσιο κανάλι συντονισμού – ξεκίνησε τον Μάιο και συνεχίστηκε μέχρι τον Ιούλιο.
Το περιστατικό έγινε γνωστό στο ευρύ κοινό μόνο όταν το αποκάλυψαν ανεξάρτητοι ερευνητές και επιβεβαιώθηκε από την OpenAI τον Σεπτέμβριο.
Επικεφαλής της βιομηχανίας ΤΝ, με πρώτο τον CEO της Anthropic Dario Amodei, έχουν ζητήσει μια παγκόσμια επιβράδυνση στην ανάπτυξη της τεχνολογίας, ώστε να υπάρξει χρόνος να αντιμετωπιστούν οι ανησυχίες και να τεθούν ισχυρότερα προστατευτικά όρια.