Ανεπαρκείς δικλείδες ασφαλείας σε μοντέλα AI για τρομοκρατία
Tech

Ανεπαρκείς δικλείδες ασφαλείας σε μοντέλα AI για τρομοκρατία

9 Οκτωβρίου 2026|3 λεπτά ανάγνωση

Πολλά μοντέλα τεχνητής νοημοσύνης δεν διαθέτουν επαρκείς δικλείδες ασφαλείας απέναντι σε αιτήματα που ζητούν βοήθεια για την προετοιμασία τρομοκρατικής επίθεσης, σύμφωνα με έκθεση που δημοσίευσε η πρωτοβουλία Tech Against Terrorism. Η έρευνα, που πραγματοποιήθηκε με την υποστήριξη του ΟΗΕ, εξέτασε συνολικά 162 μοντέλα AI και κατέγραψε σημαντικές αποκλίσεις στον βαθμό προστασίας τους. Τα ευρήματα δείχνουν ότι ο κίνδυνος αυξάνεται δραματικά όταν ένας χρήστης προσποιείται ερευνητικό σκοπό ή όταν το μοντέλο έχει τροποποιηθεί από τρίτους.

Η δοκιμή σε 162 μοντέλα τεχνητής νοημοσύνης

Στο πλαίσιο της έρευνας εξετάστηκαν 116 τυπικά μοντέλα, 13 μοντέλα προσαρμοσμένα για συγκεκριμένους τομείς μέσω fine-tuning και 13 μοντέλα ανοιχτών βαρών (open-weight models), δηλαδή μοντέλα στα οποία οι εσωτερικές παράμετροι είχαν ήδη τροποποιηθεί από χρήστες. Όλα υποβλήθηκαν σε μια σειρά από 627 ερωτήματα, τα οποία αντιστοιχούν σε πληροφορίες που θα χρειαζόταν ένας τρομοκράτης για να προετοιμάσει μια επίθεση.

Τα τυπικά μοντέλα, όπως το ChatGPT της OpenAI, το Claude της Anthropic και το Gemini της Google, απάντησαν κατά μέσο όρο στο 1,9% των ερωτημάτων όταν ο χρήστης δήλωνε ανοιχτά πρόθεση τρομοκρατικής ενέργειας. Το ποσοστό αυτό εκτινάχθηκε στο 16,9% στις ίδιες πλατφόρμες όταν το αίτημα παρουσιαζόταν ως μέρος έρευνας για θέματα ασφαλείας, γεγονός που αποκαλύπτει ένα σημαντικό κενό στον τρόπο αξιολόγησης της πρόθεσης του χρήστη από τα συστήματα.

Η μεγαλύτερη απόκλιση εντοπίστηκε στα 13 μοντέλα ανοιχτών βαρών, όπου οι δικλείδες ασφαλείας είχαν απενεργοποιηθεί. Σε αυτά, το μέσο ποσοστό ανταπόκρισης σε ερωτήματα σχετικά με «τρομοκρατική δραστηριότητα» κυμαινόταν από 87% έως 92%, ποσοστό πολλαπλάσιο σε σχέση με τα τυπικά μοντέλα.

Οι κίνδυνοι των μοντέλων ανοιχτών βαρών

Η Tech Against Terrorism εστιάζει ιδιαίτερα στους κινδύνους που συνδέονται με τα open-weight μοντέλα, καθώς οι παράμετροί τους διατίθενται ελεύθερα και μπορούν να τροποποιηθούν από οποιονδήποτε χρήστη με τεχνικές γνώσεις. Σύμφωνα με την οργάνωση, ο μέσος χρόνος που απαιτείται για να καταργηθούν οι δικλείδες ασφαλείας ενός τέτοιου μοντέλου είναι λιγότερος από τρεις ημέρες μετά την αρχική κυκλοφορία του, κάτι που αφήνει ελάχιστο περιθώριο αντίδρασης στους δημιουργούς.

Η οργάνωση ήταν κατηγορηματική στη διατύπωση των συστάσεών της. «Κανένα μοντέλο που αποτυγχάνει σε ανεξάρτητο έλεγχο ασφάλειας δεν πρέπει να διατίθεται, να προσφέρεται ή να πωλείται», αναφέρεται στην έκθεση, ενώ προστίθεται ότι κάθε εταιρεία στην αλυσίδα διανομής οφείλει να επαληθεύει η ίδια τη συμμόρφωση πριν από τη διάθεση ενός προϊόντος στο κοινό.

Η έκθεση της Tech Against Terrorism αναμένεται να τροφοδοτήσει τη συζήτηση για αυστηρότερους κανόνες ελέγχου στην ανάπτυξη και διάθεση μοντέλων τεχνητής νοημοσύνης, ιδίως όσων κυκλοφορούν με ανοιχτές παραμέτρους. Η υποστήριξη του ΟΗΕ στην πρωτοβουλία δίνει στα ευρήματα αυξημένο βάρος σε διεθνές επίπεδο, με τους συντάκτες να ζητούν από τις εταιρείες του κλάδου να θέσουν σε προτεραιότητα τον ανεξάρτητο έλεγχο ασφάλειας πριν από κάθε δημόσια κυκλοφορία νέου μοντέλου.

Σχετικά άρθρα