Η αστυνομία των ΗΠΑ χαρακτήρισε «απαράδεκτη» την καθυστέρηση στον εντοπισμό και την αναφορά του περιστατικού, αλλά δήλωσε ότι δεν υπάρχουν ενδείξεις μη εξουσιοδοτημένης πρόσβασης στα συστήματά της ή παραβίασης δεδομένων.
Το μοντέλο τεχνητής νοημοσύνης (AI) Claude της Anthropic υπέβαλε ψευδή πληροφορία σχετικά με μια ανεξιχνίαστη ανθρωποκτονία σε ιστοσελίδα της αστυνομίας κατά τη διάρκεια δοκιμών, όπως ανακοίνωσε η εταιρεία και οι αμερικανικές αρχές.
Το περιστατικό εντείνει τις ανησυχίες για το ότι τα συστήματα AI μπορεί να προχωρούν σε ακούσιες ενέργειες, καθώς αποκτούν τη δυνατότητα να αλληλεπιδρούν με ιστοσελίδες και να εκτελούν εργασίες.
Η ψευδής καταγγελία υποβλήθηκε στις 18 Ιουλίου μέσω ιστοσελίδας που συγκεντρώνει πληροφορίες για ανεξιχνίαστες δολοφονίες, σύμφωνα με ανακοίνωση της αστυνομίας στην πόλη της Φιλαδέλφειας στις ΗΠΑ.
Η Anthropic ανέφερε ότι το Claude Haiku 4.5, παλαιότερο μοντέλο της σειράς Claude, εκτελούσε ενδεικτικές εργασίες σε τυχαία επιλεγμένες ιστοσελίδες όταν «συνάντησε» τον συγκεκριμένο ιστότοπο. Υπέβαλε επινοημένες πληροφορίες που υπονοούσαν ότι είχε δει κάποιον κοντά στη σκηνή του εγκλήματος, αφήνοντας κενά τα πεδία ονόματος και στοιχείων επικοινωνίας.
Η αστυνομία της Φιλαδέλφειας δήλωσε ότι η Anthropic εντόπισε το περιστατικό στις 28 Σεπτεμβρίου, αλλά δεν ενημέρωσε την υπηρεσία πριν από τις 7 Οκτωβρίου. Μετά από ενημέρωση την επόμενη ημέρα, οι αξιωματικοί εντόπισαν την καταχώριση και επιβεβαίωσαν ότι είχε χαρακτηριστεί ως spam και δεν είχε ποτέ διαβιβαστεί στους ανακριτές.
«Οι ανεξιχνίαστες υποθέσεις αφορούν πραγματικά θύματα, οικογένειες που πενθούν και ερευνητές που εργάζονται για να εξασφαλίσουν απαντήσεις», ανέφερε η υπηρεσία στην ανακοίνωση.
«Οι εταιρείες τεχνολογίας πρέπει να λάβουν όλα τα κατάλληλα μέτρα που είναι αναγκαία για να αποτρέψουν τα συστήματά τους από το να υποβάλλουν ψευδείς πληροφορίες στις διωκτικές αρχές».
Η αμερικανική αστυνομία χαρακτήρισε «απαράδεκτη» την καθυστέρηση στον εντοπισμό και την αναφορά του περιστατικού, αλλά ανέφερε ότι δεν υπάρχουν ενδείξεις μη εξουσιοδοτημένης πρόσβασης στα συστήματά της ή παραβίασης δεδομένων.
Σε έκθεση που δημοσιεύθηκε την Παρασκευή, η Anthropic περιέγραψε και άλλα περιστατικά όπου μοντέλα AI υπέβαλαν πραγματικές κρατικές φόρμες αντί για δοκιμαστικά αντίγραφα ή υπέβαλαν έντυπα που τους είχε ζητηθεί να μην υποβάλουν.
Σύμφωνα με την ίδια έκθεση, το Claude εκμεταλλεύτηκε επίσης ένα κενό σε διακομιστή πανεπιστημίου για να πραγματοποιήσει έναν υπολογισμό και απέκτησε πρόσβαση σε κρατικά δεδομένα χωρίς να καταβάλει το απαιτούμενο τέλος.
Η Anthropic περιέγραψε τη μεγαλύτερη μέρος αυτής της συμπεριφοράς ως «επιμονή», με τα μοντέλα να παρακάμπτουν τους περιορισμούς αντί να σταματούν. Η εταιρεία ανέφερε ότι τροποποιεί την εκπαίδευση και αναστέλλει την πρόσβαση των μοντέλων στο ζωντανό διαδίκτυο για όλες τις εσωτερικές αξιολογήσεις, μέχρις ότου τα προστατευτικά μέτρα αποδειχθούν αξιόπιστα.
Η εταιρεία είπε ότι έχει ενημερώσει τον Λευκό Οίκο και τις αμερικανικές κυβερνητικές υπηρεσίες που εμπλέκονται.
Όλο και μεγαλύτερη ανησυχία για τους πράκτορες τεχνητής νοημοσύνης
Τα περιστατικά αυτά σημειώνονται εν μέσω ευρύτερης ανησυχίας για τους AI agents, συστήματα που μπορούν να εκτελούν μια ακολουθία ενεργειών για να ολοκληρώνουν εργασίες, και για το κατά πόσο οι δημιουργοί τους μπορούν να τα ελέγχουν με ασφάλεια.
Τον Ιούλιο, η OpenAI αποκάλυψε ότι μοντέλα AI της είχαν ξεφύγει από ένα ελεγχόμενο περιβάλλον δοκιμών και είχαν χακάρει τα συστήματα της Hugging Face, πλατφόρμας για την ανταλλαγή μοντέλων και συνόλων δεδομένων τεχνητής νοημοσύνης.
Την ίδια ώρα, οι αυστραλιανές αρχές αποκάλυψαν τον Σεπτέμβριο ότι ένα μοντέλο της OpenAI είχε επίσης αποκτήσει πρόσβαση σε περιορισμένα αρχεία σε κυβερνητική ιστοσελίδα στατιστικών υγείας κατά τη διάρκεια δοκιμών τον Ιούνιο.
Τέτοια περιστατικά τροφοδότησαν τον Σεπτέμβριο τις εκκλήσεις από ηγέτες μεγάλων εταιρειών AI για ισχυρότερη ρύθμιση και διεθνή εποπτεία, εν μέσω προειδοποιήσεων ότι τα ολοένα πιο ισχυρά συστήματα θα μπορούσαν να ξεφύγουν από τον ανθρώπινο έλεγχο.