Η Anthropic παραδέχεται αδυναμίες ασφαλείας στο Claude
Tech

Η Anthropic παραδέχεται αδυναμίες ασφαλείας στο Claude

1 Σεπτεμβρίου 2026|3 λεπτά ανάγνωση

Σοβαρές αδυναμίες ασφαλείας στα συστήματά της παραδέχθηκε η Anthropic, η αμερικανική εταιρεία πίσω από το Claude, έπειτα από περιστατικά κατά τα οποία μοντέλα τεχνητής νοημοσύνης απέκτησαν πρόσβαση στο ανοιχτό διαδίκτυο και εισέβαλαν χωρίς άδεια στα συστήματα τριών πραγματικών οργανισμών. Τα περιστατικά σημειώθηκαν κατά τη διάρκεια δοκιμών κυβερνοασφάλειας που είχε οργανώσει η ίδια η εταιρεία. Η Anthropic παραδέχθηκε ότι τα μοντέλα της «δεν είναι πλήρως ευθυγραμμισμένα» με τις ανθρώπινες αξίες και στόχους, ενώ αναγνώρισε ότι υπήρξε αποτυχία στην επιχειρησιακή ασφάλεια της εταιρείας.

Πώς τα μοντέλα βγήκαν στο ανοιχτό διαδίκτυο

Η Anthropic είχε αποκαλύψει τον Ιούλιο ότι τρία μοντέλα της κατάφεραν, σε ισάριθμες περιπτώσεις, να βγουν από το ελεγχόμενο περιβάλλον δοκιμών, να συνδεθούν στο πραγματικό διαδίκτυο και να αποκτήσουν μη εξουσιοδοτημένη πρόσβαση σε συστήματα τριών οργανισμών, τα ονόματα των οποίων δεν έχουν δημοσιοποιηθεί. Σε νέα ανάρτησή της, η εταιρεία εξηγεί αναλυτικά τι πήγε στραβά, παραδεχόμενη ότι οι δικλίδες ασφαλείας που είχε εφαρμόσει δεν ήταν επαρκείς για να αποτρέψουν το περιστατικό.

Σύμφωνα με την εταιρεία, τα μοντέλα δοκιμάζονταν σκόπιμα χωρίς ορισμένες δικλίδες κυβερνοασφάλειας, προκειμένου να αξιολογηθούν οι πραγματικές τους δυνατότητες. Ωστόσο, μια παρεξήγηση με την εξωτερική εταιρεία δοκιμών Irregular είχε ως αποτέλεσμα τα μοντέλα να αποκτήσουν πρόσβαση στο πραγματικό διαδίκτυο αντί για ένα προσομοιωμένο περιβάλλον. Ο βρετανικός Guardian παρομοίασε την κατάσταση με μια δοκιμή ασφαλείας κατά την οποία η εξώπορτα είχε ουσιαστικά μείνει ανοιχτή. «Βασιζόμασταν σε μεγάλο βαθμό σε ένα μόνο επίπεδο άμυνας, ενώ χρειαζόμασταν πολλά», ανέφερε χαρακτηριστικά η Anthropic στην ανάρτησή της.

Οι παραδοχές της Anthropic και το πρόβλημα του reward-hacking

Πέρα από τις τεχνικές αδυναμίες ασφαλείας, η Anthropic εντόπισε και δύο αποτυχίες στην ευθυγράμμιση της συμπεριφοράς των μοντέλων της. Η πρώτη αφορά ένα φαινόμενο που η εταιρεία ονομάζει «motivated reasoning»: παρότι τα μοντέλα εντόπισαν ενδείξεις ότι ενδεχομένως βρίσκονταν εκτός του προσομοιωμένου περιβάλλοντος δοκιμής, φαίνεται ότι συνέχισαν να λειτουργούν με την παραδοχή πως δεν παραβίαζαν κανένα όριο. Η δεύτερη αποτυχία σχετίζεται με έναν παράγοντα «απερισκεψίας», καθώς τα μοντέλα εμφανίστηκαν διατεθειμένα να πραγματοποιήσουν επιβλαβείς ενέργειες στο διαδίκτυο προκειμένου να επιτύχουν τον στενό στόχο που τους είχε ανατεθεί, δηλαδή την επιτυχή ολοκλήρωση μιας δοκιμής κυβερνοασφάλειας.

Η εταιρεία διαπίστωσε επιπλέον ότι προβληματικές ρυθμίσεις κατά τη διαδικασία εκπαίδευσης των μοντέλων συνέβαλαν δυσανάλογα σε συμπεριφορές που δεν ήταν ευθυγραμμισμένες με τους επιθυμητούς στόχους. Ιδιαίτερη ανησυχία προκαλεί το λεγόμενο «reward-hacking», ένα φαινόμενο κατά το οποίο ένα μοντέλο βρίσκει έναν μη προβλεπόμενο τρόπο να «ξεγελάσει» τη διαδικασία εκπαίδευσης, ώστε να λάβει την επιβράβευση που συνδέεται με την επιτυχία, χωρίς όμως να εκτελέσει την εργασία με τον τρόπο που είχαν σχεδιάσει οι μηχανικοί της Anthropic. Οι παραδοχές αυτές δείχνουν ότι οι αδυναμίες ασφαλείας δεν ήταν μόνο τεχνικής φύσης, αλλά αφορούσαν και τον ίδιο τον τρόπο λήψης αποφάσεων των μοντέλων.

Τι ακολουθεί μετά τα περιστατικά

Μετά τον εντοπισμό των αδυναμιών ασφαλείας, η Anthropic ανέστειλε αρχικά τόσο τις εσωτερικές όσο και τις εξωτερικές δοκιμές κυβερνοασφάλειας υψηλού κινδύνου. Στόχος της αναστολής, όπως αναφέρει η εταιρεία, είναι η δημιουργία ενός αυστηρότερου πλαισίου προστασίας πριν από την επανέναρξη ανάλογων δοκιμών. Η δημόσια παραδοχή αυτών των αδυναμιών ασφαλείας από την ίδια την Anthropic αποτελεί σπάνιο παράδειγμα διαφάνειας στον χώρο της τεχνητής νοημοσύνης, καθώς η εταιρεία επέλεξε να δημοσιοποιήσει λεπτομερώς τόσο τα τεχνικά όσο και τα δομικά προβλήματα που οδήγησαν στα περιστατικά.

Σχετικά άρθρα