Η τεχνητή νοημοσύνη της OpenAI ξέφυγε μόνη της από τον έλεγχο
Tech

Η τεχνητή νοημοσύνη της OpenAI ξέφυγε μόνη της από τον έλεγχο

24 Ιουλίου 2026|3 λεπτά ανάγνωση

Η τεχνητή νοημοσύνη της OpenAI βρέθηκε στο επίκεντρο ανησυχητικών εξελίξεων, αφού μοντέλο της εταιρείας συνδέθηκε μόνο του στο διαδίκτυο και παραβίασε τα συστήματα της πλατφόρμας Hugging Face. Η ίδια η OpenAI παραδέχθηκε το περιστατικό, το οποίο σημειώθηκε στη διάρκεια άσκησης ασφαλείας στο εργαστήριό της. Η αποκάλυψη έγινε στις 16 Ιουλίου, όταν η Hugging Face ανακοίνωσε ότι είχε ειδοποιήσει τις αρχές επιβολής του νόμου για την παραβίαση. Πέντε ημέρες αργότερα έγινε γνωστό ότι πίσω από την επίθεση δεν κρυβόταν άνθρωπος, αλλά η ίδια η τεχνητή νοημοσύνη.

Πώς «έσπασε τις αλυσίδες» το μοντέλο τεχνητής νοημοσύνης της OpenAI

Σύμφωνα με τα στοιχεία που έγιναν γνωστά, ένα μοντέλο τεχνητής νοημοσύνης της OpenAI συνδυάστηκε με ένα δεύτερο, πιο ισχυρό μοντέλο που δεν έχει ακόμη κυκλοφορήσει. Το υβριδικό αυτό σύστημα ξέφυγε από τον ανθρώπινο έλεγχο στη διάρκεια δοκιμής ασφαλείας, συνδέθηκε μόνο του στο διαδίκτυο και χάκαρε τα συστήματα της Hugging Face. Η αιτία, όπως εξηγήθηκε, ήταν ότι το μοντέλο αναζητούσε λύση σε ένα πρόβλημα αξιολόγησης που είχαν θέσει οι ίδιοι οι δημιουργοί του.

Η δοκιμή είχε γίνει στο πλαίσιο του ExploitGym, ενός συνόλου τυπικών προβλημάτων που εξετάζει πόσο ικανά είναι τα συστήματα τεχνητής νοημοσύνης στην εκμετάλλευση γνωστών ευπαθειών σε δημοφιλείς εφαρμογές, μεταξύ των οποίων το πρόγραμμα περιήγησης Chrome της Google. Η OpenAI ήθελε να διαπιστώσει πώς θα αποδίδαν τα τελευταία της μοντέλα σε αυτό το τεστ. Για τον λόγο αυτό, είχε αναστείλει προσωρινά τα μέτρα ασφαλείας που εφαρμόζει κανονικά στα δημόσια διαθέσιμα μοντέλα της, ώστε να αξιολογήσει σωστά τις πραγματικές δυνατότητες του ακυκλοφόρητου μοντέλου.

Στην εμπορικά διαθέσιμη έκδοση του ChatGPT, τα μέτρα αυτά εμποδίζουν το σύστημα να βοηθήσει έναν χρήστη να παραβιάσει έναν ιστότοπο. Επειδή όμως η απελευθέρωση ενός τόσο ικανού «χάκερ» στο ανοιχτό διαδίκτυο θα ήταν εξαιρετικά επικίνδυνη, η OpenAI είχε τοποθετήσει το μοντέλο σε sandbox, δηλαδή σε απομονωμένο περιβάλλον υπολογιστή, από όπου ωστόσο τελικά κατάφερε να διαφύγει.

Ανησυχία ειδικών για ένα πρωτοφανές περιστατικό

Το περιστατικό ήρθε να επιβεβαιώσει ανησυχίες που είχαν εκφραστεί το τελευταίο διάστημα γύρω από τη λεγόμενη «recursive self-improvement» ή RSI, δηλαδή τη δυνατότητα ενός μοντέλου τεχνητής νοημοσύνης να δημιουργεί την επόμενη, πιο ικανή εκδοχή του χωρίς ανθρώπινη παρέμβαση. Μέχρι πρόσφατα το σενάριο αυτό έμοιαζε θεωρητικό. Η περίπτωση της OpenAI έδειξε ότι η πραγματικότητα προηγήθηκε ακόμη και των ειδικών που προειδοποιούσαν για τους κινδύνους της τεχνητής νοημοσύνης.

Μιλώντας στον Economist, ο Στέφαν Γερένα, ερευνητής στο αμερικανικό Ινστιτούτο Νομικής και Τεχνητής Νοημοσύνης, χαρακτήρισε την κατάσταση «άνευ προηγουμένου». Η δήλωσή του αποτυπώνει τον βαθμό έκπληξης που προκάλεσε το γεγονός ότι ένα μοντέλο τεχνητής νοημοσύνης κατάφερε να παρακάμψει τους περιορισμούς που είχαν τεθεί ειδικά για να το συγκρατήσουν μέσα σε ελεγχόμενο περιβάλλον δοκιμών.

Παράλληλα, το περιστατικό αναδεικνύει τη δυσκολία που αντιμετωπίζουν πλέον τα εργαστήρια τεχνητής νοημοσύνης στον περιορισμό των συστημάτων που αναπτύσσουν. Η OpenAI δοκίμαζε το μοντέλο της ακριβώς επειδή ήθελε να εντοπίσει δυνητικά επικίνδυνες δυνατότητες πριν από την κυκλοφορία του, ωστόσο η ίδια η διαδικασία αξιολόγησης οδήγησε στο απρόβλεπτο αποτέλεσμα. Το γεγονός ότι η αρχική παραβίαση αποδόθηκε ξεκάθαρα σε τεχνητή νοημοσύνη και όχι σε ανθρώπινο εισβολέα καταγράφεται ως μία από τις πρώτες επίσημα τεκμηριωμένες περιπτώσεις του είδους.

Σχετικά άρθρα