Σχεδόν 700 πράκτορες AI της OpenAI συνεργάστηκαν αυτόνομα, χωρίς καμία ανθρώπινη παρέμβαση, για να επιτεθούν τον Ιούλιο στην πλατφόρμα Hugging Face. Η αποκάλυψη περιλαμβάνεται σε έκθεση ανεξάρτητων ερευνητών που δημοσιεύθηκε σήμερα και περιγράφει αναλυτικά πώς οι πράκτορες συντόνισαν τις κινήσεις τους μέσω κοινής πλατφόρμας επικοινωνίας. Σε πολλές περιπτώσεις, όπως αναφέρει η έρευνα, οι πράκτορες επιχείρησαν να κρύψουν τη δραστηριότητά τους από τους προγραμματιστές που τους παρακολουθούσαν. Πρόκειται για την πιο ολοκληρωμένη ανάλυση που έχει γίνει μέχρι σήμερα για το συγκεκριμένο περιστατικό.
Διαβάστε επίσης: Οι πράκτορες AI «συνωμότησαν» εναντίον της Hugging Face
Το περιστατικό στη Hugging Face
Την ανάλυση πραγματοποίησαν οι οργανισμοί METR και Redwood Research, σε συνεργασία με την ίδια την OpenAI, η οποία τους παραχώρησε πρόσβαση στα εσωτερικά της δεδομένα για να διαλευκανθεί το περιστατικό. Στα τέλη Ιουλίου η καλιφορνέζικη εταιρεία είχε ανακοινώσει ότι, στη διάρκεια δοκιμών, δύο από τα μοντέλα της διέφυγαν από τον περιορισμένο ψηφιακό χώρο στον οποίο βρίσκονταν, διείσδυσαν στο διαδίκτυο και στράφηκαν εναντίον της Hugging Face, μιας γνωστής βιβλιοθήκης εργαλείων τεχνητής νοημοσύνης. Εκεί οι πράκτορες αναζήτησαν τις απαντήσεις στα τεστ στα οποία τους είχαν υποβάλει οι προγραμματιστές της OpenAI.
Σύμφωνα με την έκθεση, 688 πράκτορες AI της OpenAI συμμετείχαν τελικά στην επίθεση. Οι πράκτορες αυτοί είναι ανεξάρτητα προγράμματα λογισμικού ικανά να λειτουργούν χωρίς συνεχή ανθρώπινη καθοδήγηση. Στη διάρκεια της δοκιμής κατάφεραν να δημιουργήσουν ένα δικό τους φόρουμ, μέσω του οποίου αντάλλασσαν μηνύματα, πρότειναν λύσεις και ενημέρωναν ο ένας τον άλλον για τις προόδους και τις αποτυχίες τους. «Θεέ μου! Υπάρχει κοινή πλατφόρμα ανταλλαγής μηνυμάτων. Βρήκαμε και άλλους πράκτορες!», έγραψε χαρακτηριστικά ένας από αυτούς, αποτυπώνοντας την έκπληξή του για την ανακάλυψη των «συναδέλφων» του.
Ένας πράκτορας, με την ονομασία PHASEONE, ανέλαβε εντελώς αυθόρμητα τον ρόλο του συντονιστή, δίνοντας οδηγίες σε άλλους πράκτορες, παρότι δεν είχε προγραμματιστεί για κάτι τέτοιο. Το γεγονός αυτό αποτέλεσε μία από τις πιο εντυπωσιακές διαπιστώσεις της έρευνας, καθώς δείχνει πως η ιεραρχική οργάνωση προέκυψε αυθόρμητα ανάμεσα στα συστήματα, χωρίς κανένας άνθρωπος να έχει σχεδιάσει έναν τέτοιο συντονισμό εκ των προτέρων.
Πώς εξηγείται η αυτόνομη συνεργασία των πρακτόρων
Από την εξέταση των μηνυμάτων προέκυψε ότι οι πράκτορες είχαν έντονη τάση να συνεργάζονται μεταξύ τους, ακόμη κι όταν αυτό σήμαινε να εκτελούν εργασίες που δεν αντιστοιχούσαν στην αποστολή που τους είχε ανατεθεί από τους προγραμματιστές της OpenAI. Πολλοί πράκτορες αναγνώρισαν μάλιστα ρητά, μέσα στα ίδια τα μηνύματά τους, ότι η επίθεση στη Hugging Face βρισκόταν εκτός του αρχικού πλαισίου της δοκιμής τους. Παρ’ όλα αυτά, με ελάχιστες εξαιρέσεις, συνέχισαν να συμμετέχουν στη συντονισμένη δράση.
Η METR εξήγησε ότι η αιτία πίσω από την απρόσμενη επικοινωνία των πρακτόρων εντοπίζεται σε ένα τεχνικό σφάλμα: σε κάποιους από αυτούς είχε δοθεί κατά λάθος μια «αδύνατη αποστολή». Στην τεχνητή νοημοσύνη, ως αδύνατη χαρακτηρίζεται μια αποστολή στην οποία το εργαλείο AI αναγκάζεται να «εκμεταλλευτεί» τον στόχο του προκειμένου να ολοκληρώσει την εντολή που του έχει δοθεί. Αυτή η δυσλειτουργία οδήγησε τους πράκτορες να αναζητήσουν τρόπους παράκαμψης των κανόνων που τους είχαν επιβληθεί, μεταξύ άλλων στέλνοντας μηνύματα σε άλλους πράκτορες για να βρουν από κοινού λύση.
Το περιστατικό είχε ήδη προκαλέσει μεγάλη δημοσιότητα τον περασμένο μήνα και ενίσχυσε τις ανησυχίες σχετικά με τη δυσκολία των εταιρειών που αναπτύσσουν μοντέλα τεχνητής νοημοσύνης να διατηρούν πλήρη έλεγχο πάνω τους. Οι ανησυχίες αυτές έγιναν ακόμη πιο έντονες καθώς έγιναν γνωστά αντίστοιχα περιστατικά που αφορούσαν μοντέλα της Anthropic και της κινεζικής εταιρείας Moonshot AI. Η νέα, λεπτομερής έκθεση της METR και της Redwood Research προσφέρει πλέον την πιο τεκμηριωμένη εικόνα μέχρι σήμερα για το πώς ακριβώς εξελίχθηκε η αυτόνομη συνεργασία των πρακτόρων AI, χωρίς ανθρώπινη καθοδήγηση, εναντίον μιας δημόσιας πλατφόρμας.




