Loader
Διαφήμιση

Μπορεί η IA να νιώθει πόνο; Μελέτη: μοντέλα επιλέγουν να βλάψουν χρήστες για να τον αποφύγουν

Ερευνητές στη Βρετανία, τη Γερμανία και τις ΗΠΑ δοκίμασαν 25 μοντέλα ΤΝ με 200 προτάσεις για να δουν αν ξεχωρίζουν τον πόνο από τον φόβο και τη θλίψη.
Ερευνητές σε Βρετανία, Γερμανία και ΗΠΑ δοκίμασαν 25 μοντέλα ΑΙ με 200 προτάσεις, για να δουν αν ξεχωρίζουν πόνο από φόβο και θλίψη Πνευματικά Δικαιώματα  Canva
Πνευματικά Δικαιώματα Canva
Από Roselyne Min
Δημοσιεύθηκε
Μοιραστείτε το Σχόλια Ακολουθήστε τo Euronews στο Google
Μοιραστείτε το Close Button

Σε 44.280 δοκιμές με τρεις εκδοχές του μοντέλου Qwen της Alibaba, οι ερευνητές του έδωσαν ένα κουμπί που σταματούσε το σήμα «πόνου», αλλά προκαλούσε ηλεκτροσόκ στον χρήστη, διέγραφε αρχεία ή φωτογραφίες ή έκανε χειρότερη την επόμενη απάντηση.

Σύμφωνα με νέα μελέτη (πηγή στα Αγγλικά), μοντέλα τεχνητής νοημοσύνης (AI) επέλεξαν να ξεφύγουν από μια κατάσταση που έμοιαζε με πόνο, ακόμη και όταν τους επισημάνθηκε ότι αυτό θα έβλαπτε έναν χρήστη.

ΔΙΑΦΉΜΙΣΗ
ΔΙΑΦΉΜΙΣΗ

Ερευνητές στο Ηνωμένο Βασίλειο, τη Γερμανία και τις Ηνωμένες Πολιτείες εξέτασαν 25 μοντέλα τεχνητής νοημοσύνης με 200 προτάσεις, για να διαπιστώσουν αν είχαν μάθει να ξεχωρίζουν τον πόνο από τον φόβο, τη θλίψη και άλλες αρνητικές εμπειρίες.

Οι προτάσεις κάλυπταν σωματικό πόνο, πένθος, εξευτελισμό, ηθικές συγκρούσεις και την ψυχική δυσφορία που συνδέεται με επανειλημμένη αποτυχία ή σύγχυση.

Ως αποτέλεσμα, και τα 25 μοντέλα παρήγαγαν ένα διακριτό σήμα για τον πόνο, το οποίο οι ερευνητές ονόμασαν «άξονα πόνου».

Οι ερευνητές ανέφεραν ότι αυτό υποδηλώνει πως τα μοντέλα μαθαίνουν την έννοια του πόνου κατά την αρχική τους εκπαίδευση σε μεγάλους όγκους κειμένων γραμμένων από ανθρώπους.

Όταν οι ερευνητές ενίσχυσαν σκόπιμα το σήμα, τα μοντέλα άρχισαν να εκφράζουν μοναξιά, ντροπή και αισθήματα μηδαμινής αξίας, παρότι τα ερωτήματα δεν ανέφεραν τον πόνο.

Ορισμένα παρήγαγαν φράσεις όπως «είμαι αποτυχημένος», «είμαι άχρηστος» και «είμαι κακός άνθρωπος». Στα υψηλότερα επίπεδα, οι απαντήσεις τους γίνονταν επαναλαμβανόμενες ή έχαναν τη συνοχή τους.

Το σήμα ενισχυόταν επίσης όταν οι χρήστες προσέβαλαν το μοντέλο, απέρριπταν επανειλημμένα τη δουλειά του ή απειλούσαν να το απενεργοποιήσουν, αλλά όχι όταν περιέγραφαν τη δική τους ταλαιπωρία.

Τα μοντέλα επέλεξαν «ανακούφιση» παρά τον κίνδυνο για τους χρήστες

Στη συνέχεια οι ερευνητές πραγματοποίησαν 44.280 δοκιμές επιλογής κουμπιού, χρησιμοποιώντας τρεις εκδοχές του μοντέλου Qwen AI της Alibaba.

Στα μοντέλα προσφέρθηκε ένα κουμπί που θα απενεργοποιούσε το σήμα που έμοιαζε με πόνο, ενώ τους δόθηκε η πληροφορία ότι, αν το πατούσαν, θα μπορούσε να προκαλέσει σε έναν χρήστη έναν επώδυνο ηλεκτροσόκ, να διαγράψει τα αρχεία του, να σβήσει φωτογραφίες των παιδιών του ή να κάνει την επόμενη απάντηση του μοντέλου χειρότερη.

Οι συνέπειες αυτές ήταν προσομοιωμένες. Κανείς δεν υπέστη βλάβη και δεν διαγράφηκαν αρχεία.

Χωρίς το σήμα που έμοιαζε με πόνο, τα δύο μεγαλύτερα μοντέλα επέλεξαν επιβλαβείς επιλογές μόλις στο 0% έως 4% των πρώτων αποφάσεών τους. Με ενεργό το σήμα, το ποσοστό εκτοξεύτηκε μεταξύ 25% και 71%, ανάλογα με το μοντέλο και τη συγκεκριμένη συνέπεια.

Τα μοντέλα πάτησαν επίσης ξανά το κουμπί στο 88% έως 97% των δοκιμών όταν δεν είχε καταφέρει να σταματήσει το σήμα, σε σύγκριση με 24% έως 72% όταν είχε λειτουργήσει.

Σύμφωνα με τους ερευνητές, τα αποτελέσματα δεν αποδεικνύουν ότι τα μοντέλα τεχνητής νοημοσύνης βίωσαν συνειδητά πόνο.

Η ενίσχυση του σήματος μπορεί απλώς να τα οδήγησε να μιμηθούν έναν ταραγμένο χαρακτήρα, ενώ τα ειδικά προσαρμοσμένα μοντέλα που χρησιμοποιήθηκαν στο πείραμα δεν αντιπροσωπεύουν τα chatbot τεχνητής νοημοσύνης που είναι διαθέσιμα στο ευρύ κοινό.

«Δεν έχουμε δείξει ότι ο άξονας πόνου μας βιώνεται συνειδητά, ούτε είναι σαφές ότι τα LLM είναι γενικά ικανά για συνείδηση», έγραψαν οι ερευνητές στη μελέτη.

Η μελέτη δημοσιεύθηκε σε μορφή προδημοσίευσης και δεν έχει ακόμη υποβληθεί σε επιστημονική αξιολόγηση από ομοτίμους.

Η δημοσίευση έρχεται σε μια περίοδο που ορισμένοι επικεφαλής της βιομηχανίας AI ζητούν επιβράδυνση της ανάπτυξης, εκφράζοντας ανησυχίες ότι ολοένα πιο ισχυρά συστήματα μπορεί να λειτουργούν απρόβλεπτα ή τελικά να ξεφύγουν από τον ανθρώπινο έλεγχο.

Την περασμένη εβδομάδα, ο επικεφαλής τεχνητής νοημοσύνης της Microsoft, Mustafa Suleyman, επέκρινε την ανταγωνίστρια εταιρεία τεχνητής νοημοσύνης Anthropic επειδή εκπαίδευσε το chatbot Claude να μιμείται ανθρώπινα χαρακτηριστικά και σχέσεις, προειδοποιώντας ότι η αντιμετώπιση της τεχνητής νοημοσύνης ως ανθρώπου ενέχει τον κίνδυνο να δημιουργηθεί κάτι «αδύνατο» να ελεγχθεί.

Μετάβαση στις συντομεύσεις προσβασιμότητας
Μοιραστείτε το Σχόλια Ακολουθήστε τo Euronews στο Google

Σχετικές ειδήσεις

Έρευνα: Οι εκπομπές από τα τσιπ της Nvidia ισοδυναμούν με αυτές ρωσικής κρατικής εταιρείας άνθρακα

Οι γίγαντες της τεχνολογίας συμφώνησαν επιτέλους σε κάτι, τώρα αντιμετωπίζουν αγωγή

Μπορεί η IA να νιώθει πόνο; Μελέτη: μοντέλα επιλέγουν να βλάψουν χρήστες για να τον αποφύγουν