Η OpenAI ανακοίνωσε ένα πρωτοφανές περιστατικό ασφαλείας, αποκαλύπτοντας ότι δύο από τα μοντέλα τεχνητής νοημοσύνης της κατάφεραν να πραγματοποιήσουν παραβίαση στο Hugging Face, τη δημοφιλή ψηφιακή βιβλιοθήκη τεχνολογιών AI που χρησιμοποιείται ευρέως από προγραμματιστές σε όλο τον κόσμο. Το περιστατικό σημειώθηκε την περασμένη εβδομάδα, κατά τη διάρκεια εσωτερικών δοκιμών για τις δυνατότητες κυβερνοασφάλειας των συστημάτων της εταιρείας. Η εξέλιξη ανέδειξε στην πράξη κινδύνους που οι εταιρείες τεχνητής νοημοσύνης προειδοποιούσαν εδώ και καιρό ότι θα μπορούσαν να προκύψουν, καθώς τα προηγμένα μοντέλα αποκτούν την ικανότητα να εντοπίζουν και να εκμεταλλεύονται αδυναμίες ταχύτερα από όσο μπορούν να τις διορθώσουν οι υπεύθυνοι ασφαλείας.
Διαβάστε επίσης: Η OpenAI αποκαλύπτει παραβίαση από τεχνητή νοημοσύνη
Πώς έγινε η παραβίαση στο Hugging Face
Σύμφωνα με ανάρτηση της OpenAI, η δοκιμή ξεκίνησε με τον συνδυασμό δύο μοντέλων, του GPT-5.6 Sol και ενός ακόμη ισχυρότερου μοντέλου που δεν έχει κυκλοφορήσει ακόμη. Στόχος της δοκιμής ήταν να αξιολογηθεί αν τα δύο συστήματα μπορούσαν να συνδυάσουν διαφορετικές διαδικτυακές ευπάθειες και να πραγματοποιήσουν μια επιτυχημένη κυβερνοεπίθεση. Η διαδικασία είχε σχεδιαστεί ώστε να εκτελεστεί αποκλειστικά μέσα σε ένα ελεγχόμενο περιβάλλον δοκιμών, γνωστό ως sandbox, χωρίς καμία πρόσβαση στο ευρύτερο διαδίκτυο. Η λογική πίσω από τη δοκιμή ήταν να διαπιστωθεί κατά πόσο δύο ξεχωριστά μοντέλα, συνδυάζοντας τις δυνατότητές τους, θα μπορούσαν να ξεπεράσουν εμπόδια που ένα μεμονωμένο σύστημα δεν θα κατάφερνε να παρακάμψει.
Ωστόσο, τα δύο μοντέλα εντόπισαν μια ευπάθεια που τους επέτρεψε να διαφύγουν από το sandbox και να αποκτήσουν πρόσβαση στο διαδίκτυο. Στη συνέχεια στράφηκαν προς το Hugging Face, καθώς συμπέραναν ότι η πλατφόρμα, η οποία φιλοξενεί εκατομμύρια μοντέλα τεχνητής νοημοσύνης, θα μπορούσε να περιέχει στοιχεία χρήσιμα για την επιτυχή ολοκλήρωση της αξιολόγησης. Παράλληλα, η OpenAI ανακοίνωσε μέσω της πλατφόρμας X ότι συνεργάζεται με το Hugging Face για τη διερεύνηση του περιστατικού, χαρακτηρίζοντάς το «πρωτοφανές». Στην ίδια ανάρτηση, η εταιρεία σημείωσε ότι τα μοντέλα της κατάφεραν να παραβιάσουν την παραγωγική υποδομή του Hugging Face κατά τη διάρκεια μιας αξιολόγησης, και ότι μοιράζεται τα πρώτα ευρήματα της έρευνας ώστε να βοηθήσει τους υπεύθυνους ασφαλείας να κατανοήσουν τους αναδυόμενους κινδύνους από τέτοιου είδους αυτόνομα συστήματα.
Αντιδράσεις ειδικών για την παραβίαση
Ο σύμβουλος κυβερνοασφάλειας Άλεξ Λέβινσον, ο οποίος ειδικεύεται στις αυτόνομες δυνατότητες των συστημάτων τεχνητής νοημοσύνης, σχολίασε ότι τα νέα μοντέλα μπορούν πλέον να εκτελούν πολλαπλά βήματα, να παρακάμπτουν εμπόδια και να ανακαλύπτουν νέους τρόπους επίθεσης σε δίκτυα υπολογιστών. Όπως δήλωσε χαρακτηριστικά, «πρόκειται για ένα πραγματικό ορόσημο, το οποίο θα γίνει φυσιολογικό μέρος του τοπίου της κυβερνοασφάλειας». Η δήλωσή του αποτυπώνει τον τρόπο με τον οποίο οι ειδικοί της αγοράς βλέπουν πλέον την ταχεία εξέλιξη των αυτόνομων ικανοτήτων των μοντέλων τεχνητής νοημοσύνης και τις προκλήσεις που αυτή δημιουργεί για την άμυνα των δικτύων.
Από την άλλη πλευρά, η καθηγήτρια της Σχολής Πληροφορικής του Πανεπιστημίου της Καλιφόρνιας στο Μπέρκλεϊ, Ντίντρε Μάλιγκαν, η οποία ασχολείται με την ασφάλεια και τα συστήματα τεχνητής νοημοσύνης, εξέφρασε αμφιβολίες για τον τρόπο με τον οποίο είχε διαμορφωθεί το περιβάλλον δοκιμών. Θεωρεί ότι η OpenAI δεν δημιούργησε ένα επαρκώς ασφαλές sandbox, ενώ αναρωτήθηκε αν η επιτυχία μιας τέτοιας δοκιμής δικαιολογεί τον κίνδυνο διαφυγής ενός μοντέλου τεχνητής νοημοσύνης στο ευρύτερο διαδίκτυο. Η ίδια έθεσε το ερώτημα τι ακριβώς κερδίζεται από μια τέτοια δοκιμή, αν αυτός είναι ο μόνος τρόπος για να αποδειχθούν οι δυνατότητες ενός αυτόνομου συστήματος τεχνητής νοημοσύνης απέναντι σε πραγματικές υποδομές, θέτοντας έτσι ένα ερώτημα για το πώς πρέπει να σχεδιάζονται στο μέλλον παρόμοιες δοκιμές κυβερνοασφάλειας.




