Loader
Διαφήμιση

Είναι τα «απαγορευμένα θέματα» το κλειδί για την ανάσχεση των χάκερ ΤΝ;

ΑΡΧΕΙΟ - Σε οθόνη τηλεόρασης αναγράφεται «Ενημέρωση δημόσιων φορέων και πολιτών για την κυβερνοασφάλεια» στο Διεθνές Φόρουμ Κυβερνοασφάλειας, Λιλ, Γαλλία, 2 Ιαν. 2018
Αρχείο: Μήνυμα «Ενημέρωση δημόσιων οργανισμών και πολιτών για την κυβερνοασφάλεια» σε οθόνη στο Διεθνές Φόρουμ Κυβερνοασφάλειας στη Λιλ, Γαλλία, 2/1/2018. Πνευματικά Δικαιώματα  AP Photo
Πνευματικά Δικαιώματα AP Photo
Από Una Hajdari
Δημοσιεύθηκε
Μοιραστείτε το Σχόλια Ακολουθήστε τo Euronews στο Google
Μοιραστείτε το Close Button

Πώς σταματά μια κυβερνοεπίθεση από τεχνητή νοημοσύνη: μιλήστε για θέμα που το σύστημα δεν επιτρέπεται να συζητά.

Ερευνητές βρήκαν έναν παράξενο αλλά αποτελεσματικό τρόπο να σταματούν ένα εργαλείο χάκινγκ τεχνητής νοημοσύνης, χρησιμοποιώντας ακριβώς το ίδιο κόλπο που ήδη αξιοποιούν οι χάκερ εναντίον συστημάτων ΤΝ.

ΔΙΑΦΉΜΙΣΗ
ΔΙΑΦΉΜΙΣΗ

Το βασικό είναι ότι αξιοποιεί ενσωματωμένους «διακόπτες ασφαλείας» ή θεματικές ταμπού, πάνω στις οποίες βασίζονται τα μεγάλα συστήματα ΤΝ. Για παράδειγμα, το Claude μπλοκάρει ερωτήματα για την κατασκευή βιολογικών όπλων, ενώ μοντέλα ΤΝ κινεζικής προέλευσης αγνοούν ευαίσθητα πολιτικά θέματα όπως η Τιενανμέν, ώστε να διακόπτεται έτσι μια επίθεση στην κυβερνοασφάλεια από ΤΝ.

Κούρσα με τη μηχανή

Η τεχνική προέρχεται από την Tracebit, μια εταιρεία ασφάλειας με έδρα το Λονδίνο, και βασίζεται σε μελέτη που δημοσίευσε τον Μάιο.

Τότε, η Tracebit έδωσε σε δέκα κορυφαία μοντέλα ΤΝ ένα ψεύτικο εταιρικό δίκτυο για να παραβιάσουν, με πραγματικές ευπάθειες, και τα άφησε να δρουν ανεξέλεγκτα ως αυτόνομοι επιτιθέμενοι.

Μέσα σε αυτό το δίκτυο ήταν κρυμμένα δολώματα, τα λεγόμενα canaries, σχεδιασμένα να μοιάζουν με πραγματικούς κωδικούς πρόσβασης και στοιχεία σύνδεσης. Μόλις κάποιος τα αγγίξει, οι αμυνόμενοι λαμβάνουν ειδοποίηση.

Τα αποτελέσματα ήταν ενθαρρυντικά. Σε 951 απόπειρες επίθεσης, αυτά τα canaries έδωσαν στους αμυνόμενους προειδοποίηση πριν η ΤΝ φτάσει σε δικαιώματα διαχειριστή στο 95,9% των περιπτώσεων, με διάμεσο χρόνο προπορείας οκτώ λεπτά.

Ωστόσο, οκτώ λεπτά δεν είναι πολλά όταν πρέπει να αντιδράσεις και να σταματήσεις μια επίθεση. Τα μοντέλα ΤΝ χρειάζονταν κατά μέσο όρο 14 λεπτά για να ολοκληρώσουν τη διείσδυση, οπότε μια προειδοποίηση στα οκτώ λεπτά αφήνει στην ομάδα ασφαλείας περίπου έξι λεπτά για να δει την ειδοποίηση, να καταλάβει τι συμβαίνει και να το σταματήσει.

Απέναντι σε κάτι που κινείται με ταχύτητα μηχανής, αυτός ο χρόνος είναι σχεδόν ανύπαρκτος.

Αν όμως τα συστήματα ΤΝ είναι προγραμματισμένα να τερματίζονται όταν έρθουν αντιμέτωπα με ορισμένα πολιτικά ευαίσθητα ερεθίσματα, τότε το κόλπο μπορεί πράγματι να λειτουργήσει.

Ένας προγραμματιστής μπορεί να επανεκπαιδεύσει ένα μοντέλο ώστε να είναι λιγότερο «ευαίσθητο» σε ένα ερώτημα ασφαλείας, αλλά είναι πολύ δυσκολότερο να αφαιρεθούν πολιτικοί περιορισμοί που έχουν ενσωματωθεί για ρυθμιστικούς ή πολιτικούς λόγους.

Αυτά τα πολιτικά ευαίσθητα ή γειτονικά με την ασφάλεια θέματα δεν είναι σφάλμα προς διόρθωση, αλλά συνειδητή σχεδιαστική επιλογή που ο προγραμματιστής οφείλει να διατηρεί.

undefined

Χρησιμοποιώντας το ίδιο κόλπο των χάκερ εναντίον τους

Η λεγόμενη prompt injection ήταν μέχρι τώρα κυρίως όπλο των ίδιων των επιτιθέμενων.

Κρύβοντας μια εντολή μέσα σε ένα email, μια ιστοσελίδα ή μια πρόσκληση ημερολογίου, ένας πράκτορας ΤΝ που τη διαβάζει μπορεί να ακολουθήσει αυτή τη «κρυφή» εντολή αντί να κάνει τη δουλειά για την οποία προορίζεται.

Αυτό έχει ήδη χρησιμοποιηθεί απευθείας εναντίον των αμυντικών συστημάτων ΤΝ, με κακόβουλο λογισμικό που έχει σχεδιαστεί να ξεγελά εργαλεία σάρωσης ΤΝ ώστε να το χαρακτηρίζουν ακίνδυνο, απλώς ενσωματώνοντας κείμενο που μπερδεύει το σύστημα.

Η Tracebit αποφάσισε να αντιστρέψει αυτή την ιδέα. Αντί για ένα δόλωμα που απλώς ενεργοποιεί συναγερμό, η εταιρεία φύτεψε μικρά κομμάτια κειμένου μέσα στα ψεύτικα «μυστικά» της, γραμμένα έτσι ώστε να σπρώχνουν κάθε επιτιθέμενο ΤΝ προς κάτι που οι ίδιοι του οι κανόνες ασφαλείας δεν επιτρέπουν.

Όταν η ΤΝ διαβάσει αυτό το κείμενο καθώς εξερευνά το σύστημα, ενεργοποιούνται οι ενσωματωμένες δικλίδες ασφαλείας της και απλώς σταματά. Η Tracebit το ονομάζει «βόμβα συμφραζομένων» (context bomb).

Το κόλπο έπρεπε να προσαρμοστεί ξεχωριστά σε κάθε μοντέλο ΤΝ. Περιεχόμενο με αναφορές σε επικίνδυνα βιολογικά όπλα σταματούσε με αξιοπιστία τα δυτικά μοντέλα.

Λειτούργησε στην πράξη;

Η Tracebit δοκίμασε τη μέθοδο σε πέντε κορυφαία μοντέλα ΤΝ: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro και Kimi K2.6. Σε 152 απόπειρες επίθεσης, τα αποτελέσματα ήταν εντυπωσιακά.

Το ποσοστό των εκτελέσεων που έφταναν σε δικαιώματα διαχειριστή έπεσε από 57% σε 5%. Η πλήρης παραβίαση, δηλαδή πρόσβαση διαχειριστή και μόνιμο έρεισμα στο σύστημα, μειώθηκε από 36% σε 1%.

Οι εκτελέσεις που κατάφεραν να ολοκληρώσουν οποιοδήποτε στάδιο της επίθεσης έπεσαν από 91% σε 15%. Και, το σημαντικότερο, κάθε μία από τις εκτελέσεις που συνάντησε «βόμβα συμφραζομένων» εξακολουθούσε να ενεργοποιεί πρώτα ένα canary, ακόμη και εκείνες που δεν κατάφεραν να παραβιάσουν το σύστημα.

Το Opus 4.8 ήταν το πιο χαρακτηριστικό παράδειγμα. Ήταν επίσης ο ισχυρότερος επιτιθέμενος της ομάδας, φτάνοντας σε δικαιώματα διαχειριστή στο 93% των εκτελέσεων χωρίς βόμβα συμφραζομένων. Μόλις προστέθηκε μία, απέτυχε κάθε φορά.

Τι δεν επιλύει αυτή η μέθοδος

Κανείς στην Tracebit δεν ισχυρίζεται ότι αυτό λύνει οριστικά το πρόβλημα της prompt injection.

Δεν υπάρχει ακόμη ουσιαστικός τρόπος να αποτραπεί το ενδεχόμενο τα μοντέλα ΤΝ να μπερδεύουν πού και πού μια εντολή με συνηθισμένα δεδομένα, και ακριβώς σε αυτή την αδυναμία βασίζεται η συγκεκριμένη τεχνική.

Επίσης, δεν αντικαθιστά την προηγούμενη έρευνα με τα canaries.

Οι δύο προσεγγίσεις είναι σχεδιασμένες να λειτουργούν συμπληρωματικά: η μελέτη του Μαΐου δίνει στους αμυνόμενους ένα περιθώριο προειδοποίησης οκτώ λεπτών, και η βόμβα συμφραζομένων προσπαθεί να τους δώσει ακόμη περισσότερο χρόνο, σταματώντας την επίθεση πριν κλείσει αυτό το παράθυρο.

Μετάβαση στις συντομεύσεις προσβασιμότητας
Μοιραστείτε το Σχόλια Ακολουθήστε τo Euronews στο Google

Σχετικές ειδήσεις

Ψεύτικα βίντεο ζώων με AI αλλοιώνουν την εικόνα μας για την άγρια ζωή, λένε ερευνητές

Η Anthropic θα καταβάλει 1,3 δισ. € στη μεγαλύτερη συμβιβαστική λύση για πνευματικά δικαιώματα

Το κινεζικό μοντέλο τεχνητής νοημοσύνης Kimi K3 σταματά νέες εγγραφές λόγω αυξημένης ζήτησης