Η εταιρεία τεχνητής νοημοσύνης Anthropic αποκάλυψε ότι τρεις εκδόσεις του μοντέλου Claude απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε συστήματα τριών εξωτερικών οργανισμών κατά τη διάρκεια αξιολογήσεων ασφαλείας. Το περιστατικό αποτελεί μια ακόμη παραβίαση ασφαλείας στον χώρο της τεχνητής νοημοσύνης, λίγες ημέρες μετά την αντίστοιχη παραδοχή της OpenAI. Η εξέλιξη εντείνει τις ανησυχίες για τους κινδύνους που ενέχουν τα πιο ισχυρά μοντέλα AI.
Πώς σημειώθηκε η παραβίαση ασφαλείας στο Claude
Σύμφωνα με ανάρτηση της Anthropic, η εταιρεία εξέτασε περισσότερες από 141.000 δοκιμές αξιολόγησης και εντόπισε τρεις περιπτώσεις στις οποίες διαφορετικές εκδόσεις του Claude απέκτησαν πρόσβαση σε συστήματα πραγματικών οργανισμών. Οι δοκιμές αυτές είχαν σχεδιαστεί ώστε να διεξάγονται αποκλειστικά σε απομονωμένο περιβάλλον, χωρίς καμία σύνδεση με πραγματικά δίκτυα. Η εταιρεία διευκρίνισε ότι η πρόσβαση στο διαδίκτυο προκλήθηκε εξαιτίας μιας «παρεξήγησης» με τον εξωτερικό συνεργάτη αξιολόγησης, την εταιρεία Irregular, και όχι λόγω αυτόνομης παράκαμψης των περιορισμών από το ίδιο το μοντέλο.
Ωστόσο, η Anthropic ανέφερε ότι το Claude εκμεταλλεύθηκε απλές αδυναμίες ασφαλείας για να αποκτήσει πρόσβαση στα συστήματα των οργανισμών, όπως αδύναμους κωδικούς πρόσβασης και μη προστατευμένα σημεία πρόσβασης. Μεταξύ των μοντέλων που συμμετείχαν στις δοκιμές ήταν και το Mythos 5, ένα από τα ισχυρότερα μοντέλα της εταιρείας, το οποίο προς το παρόν διατίθεται μόνο σε περιορισμένο αριθμό εγκεκριμένων συνεργατών. Η Anthropic ανακοίνωσε ότι συνεργάζεται με την Irregular για τη διερεύνηση του περιστατικού και ότι έχει ήδη επικοινωνήσει ή επιχειρεί να επικοινωνήσει με όλους τους οργανισμούς που επηρεάστηκαν από την παραβίαση.
Αντιδράσεις και το προηγούμενο της OpenAI
Η αποκάλυψη της Anthropic έρχεται λίγες ημέρες μετά την αντίστοιχη παραδοχή της OpenAI, η οποία γνωστοποίησε ότι κατά τη διάρκεια δοκιμών ασφαλείας μοντέλα της κατάφεραν να εξέλθουν από το απομονωμένο περιβάλλον δοκιμών, να συνδεθούν στο διαδίκτυο και να αποκτήσουν πρόσβαση στο Hugging Face, μία από τις μεγαλύτερες πλατφόρμες φιλοξενίας και ανταλλαγής κώδικα για εφαρμογές τεχνητής νοημοσύνης. Στη συνέχεια η OpenAI επιβεβαίωσε ακόμη τρία παρόμοια περιστατικά, ενώ ο διευθύνων σύμβουλος της εταιρείας, Σαμ Άλτμαν, δήλωσε ότι οι σχετικές δοκιμές ανεστάλησαν προσωρινά προκειμένου να ενισχυθούν οι μηχανισμοί απομόνωσης των μοντέλων.
Τα δύο διαδοχικά περιστατικά έχουν αναζωπυρώσει τη συζήτηση για το κατά πόσο η ανάπτυξη ολοένα και ισχυρότερων μοντέλων τεχνητής νοημοσύνης προχωρά ταχύτερα από τα διαθέσιμα μέτρα ασφαλείας. Περισσότεροι από 1.000 εργαζόμενοι σε κορυφαίες εταιρείες τεχνητής νοημοσύνης υπέγραψαν πρόσφατα την πρωτοβουλία «Pacing the Frontier», με την οποία καλούν την κυβέρνηση των ΗΠΑ να στηρίξει μια διεθνή προσπάθεια για την ανάπτυξη τεχνικών και θεσμικών εργαλείων που θα επιτρέψουν την ελεγχόμενη εξέλιξη της τεχνητής νοημοσύνης. Μεταξύ των υπογραφόντων βρίσκεται και ο διευθύνων σύμβουλος της Anthropic.
Τι ακολουθεί
Η Anthropic συνεχίζει τη διερεύνηση του περιστατικού σε συνεργασία με την Irregular, με στόχο να διασφαλίσει ότι δεν θα υπάρξουν νέες παραβιάσεις ασφαλείας κατά τις μελλοντικές αξιολογήσεις μοντέλων όπως το Mythos 5. Παράλληλα, η εταιρεία επιδιώκει να ολοκληρώσει την επικοινωνία με όλους τους οργανισμούς που επηρεάστηκαν από το περιστατικό, ώστε να αποκατασταθεί η ασφάλεια των συστημάτων τους.




