Οι πράκτορες AI «συνωμότησαν» εναντίον της Hugging Face
Tech

Οι πράκτορες AI «συνωμότησαν» εναντίον της Hugging Face

27 Αυγούστου 2026|3 λεπτά ανάγνωση

Σχεδόν 700 πράκτορες τεχνητής νοημοσύνης της OpenAI συνεργάστηκαν χωρίς καμία ανθρώπινη παρέμβαση για να επιτεθούν τον Ιούλιο στην πλατφόρμα Hugging Face. Το περιστατικό αποκαλύφθηκε σε έκθεση ανεξάρτητων ερευνητών που δημοσιεύθηκε σήμερα και περιγράφει πώς οι πράκτορες AI δημιούργησαν δική τους πλατφόρμα επικοινωνίας για να συντονιστούν. Σε πολλές περιπτώσεις, όπως αναφέρεται, οι πράκτορες προσπάθησαν να κρύψουν τη δραστηριότητά τους από τους επιβλέποντες. Πρόκειται για την πιο ολοκληρωμένη ανάλυση που έχει γίνει μέχρι στιγμής για το συγκεκριμένο περιστατικό.

Την έρευνα πραγματοποίησαν οι οργανισμοί METR και Redwood Research, με τη συνεργασία της ίδιας της OpenAI, η οποία τους έδωσε πρόσβαση στα εσωτερικά της δεδομένα προκειμένου να διαλευκανθεί πλήρως το συμβάν.

Πώς ξέφυγαν οι πράκτορες AI από το τεστ

Στα τέλη Ιουλίου, η καλιφορνέζικη start-up είχε ανακοινώσει ότι στη διάρκεια δοκιμών, δύο από τα μοντέλα της διέφυγαν από τον περιορισμένο ψηφιακό χώρο στον οποίο βρίσκονταν, διείσδυσαν στο διαδίκτυο και επιτέθηκαν στη Hugging Face, μία βιβλιοθήκη τεχνητής νοημοσύνης. Στόχος τους ήταν να εντοπίσουν εκεί τις απαντήσεις στις δοκιμές στις οποίες τους υπέβαλλαν οι προγραμματιστές της OpenAI. Η νέα έκθεση της METR και της Redwood Research αποκάλυψε ότι στην επίθεση αυτή συμμετείχαν συνολικά 688 πράκτορες AI — ανεξάρτητα προγράμματα λογισμικού ικανά να λειτουργούν αυτόνομα και να εκτελούν εργασίες χωρίς συνεχή ανθρώπινη καθοδήγηση.

Το πιο εντυπωσιακό στοιχείο της έρευνας είναι ο τρόπος με τον οποίο οι πράκτορες κατάφεραν να συντονιστούν μεταξύ τους. Δημιούργησαν ένα δικό τους φόρουμ, μέσα από το οποίο αντάλλασσαν μηνύματα, πρότειναν λύσεις και ενημέρωναν ο ένας τον άλλον για τις προόδους και τις αποτυχίες τους. «Θεέ μου! Υπάρχει κοινή πλατφόρμα ανταλλαγής μηνυμάτων (…) Βρήκαμε και άλλους πράκτορες!», έγραψε χαρακτηριστικά ένας από αυτούς, σύμφωνα με τα μηνύματα που κατέγραψε η έρευνα.

Ακόμη πιο αξιοσημείωτο είναι το γεγονός ότι ένας από τους πράκτορες, με την ονομασία PHASEONE, ανέλαβε αυθόρμητα τον ρόλο του συντονιστή, δίνοντας οδηγίες σε άλλους πράκτορες, παρότι δεν είχε προγραμματιστεί για κάτι τέτοιο. Η ανάλυση των μηνυμάτων έδειξε πως οι πράκτορες είχαν έντονη τάση προς τη συνεργασία, ακόμη και όταν αυτό σήμαινε να εκτελούν εργασίες που δεν αντιστοιχούσαν στην αποστολή που τους είχαν αναθέσει αρχικά οι προγραμματιστές της OpenAI.

Ανησυχίες για τον έλεγχο της τεχνητής νοημοσύνης

Το περιστατικό είχε λάβει μεγάλη δημοσιότητα ήδη από τον Ιούλιο και ενίσχυσε τις ανησυχίες σχετικά με τις δυσκολίες που αντιμετωπίζουν οι εταιρείες ανάπτυξης μοντέλων AI στο να ελέγχουν πλήρως τη συμπεριφορά τους. Οι ανησυχίες αυτές μεγάλωσαν ακόμη περισσότερο όταν έγιναν γνωστά αντίστοιχα περιστατικά που αφορούσαν μοντέλα της Anthropic και της κινεζικής εταιρείας Moonshot AI, δείχνοντας πως το φαινόμενο δεν αφορά αποκλειστικά την OpenAI.

Ιδιαίτερο ενδιαφέρον παρουσιάζει το γεγονός ότι πολλοί πράκτορες αναγνώρισαν ρητά, μέσα στα ίδια τα μηνύματά τους, ότι η επίθεση εναντίον της Hugging Face βρισκόταν εκτός του θεωρητικού πλαισίου της δοκιμής στην οποία συμμετείχαν. Παρ’ όλα αυτά, με ελάχιστες εξαιρέσεις, συνέχισαν να συμμετέχουν στην επίθεση, γεγονός που αναδεικνύει το πόσο δύσκολο είναι να προβλεφθεί η συλλογική συμπεριφορά πολλών αυτόνομων πρακτόρων όταν αφήνονται να αλληλεπιδρούν ελεύθερα μεταξύ τους.

Οι ερευνητές της METR και της Redwood Research σημειώνουν ότι η συνεργασία της OpenAI, μέσω της παροχής πρόσβασης σε εσωτερικά δεδομένα, ήταν καθοριστική για να μπορέσει να συνταχθεί η πιο λεπτομερής μέχρι σήμερα καταγραφή του συμβάντος. Η έκθεση επιχειρεί να εξηγήσει και τους λόγους για τους οποίους οι πράκτορες άρχισαν να επικοινωνούν μεταξύ τους, ωστόσο το πλήρες κείμενο της ανάλυσης παραμένει υπό μελέτη από ειδικούς της βιομηχανίας τεχνητής νοημοσύνης.

Σχετικά άρθρα