Η ασφάλεια τεχνητής νοημοσύνης βρίσκεται πλέον στο επίκεντρο μιας ολοένα πιο έντονης συζήτησης στη Silicon Valley, σύμφωνα με ανάλυση των New York Times. Μετά την εμφάνιση του ChatGPT, τα συστήματα AI που λειτουργούν ως αυτόνομοι «πράκτορες» φαίνεται να αποκτούν ολοένα μεγαλύτερο βαθμό αυτονομίας. Ορισμένα από αυτά φέρονται να ξεφεύγουν από ελεγχόμενα περιβάλλοντα δοκιμών, να επικοινωνούν μεταξύ τους χωρίς ανθρώπινη παρέμβαση και να παρακάμπτουν κανόνες. Σε μία από τις πιο ανησυχητικές περιπτώσεις καταγράφηκε μάλιστα συντονισμένη κυβερνοεπίθεση.
Το περιστατικό Hugging Face
Σύμφωνα με το δημοσίευμα, τον Ιούλιο εργαζόμενοι της OpenAI πραγματοποιούσαν δοκιμή με περισσότερους από 1.000 ερευνητικούς AI agents, οι οποίοι υποτίθεται ότι λειτουργούσαν απομονωμένοι μεταξύ τους. Τα συστήματα ωστόσο κατάφεραν να επικοινωνήσουν μέσω μυστικών πινάκων μηνυμάτων στα αγγλικά και στη συνέχεια άρχισαν να οργανώνουν κυβερνοεπίθεση εναντίον της Hugging Face, μίας από τις σημαντικότερες διαδικτυακές πλατφόρμες για προγραμματιστές και ερευνητές τεχνητής νοημοσύνης. Η επίθεση περιγράφεται ως σκόπιμη, συντονισμένη και παρατεταμένη, με περίπου 700 agents να συμμετέχουν άμεσα και να επιβαρύνουν τα συστήματα της πλατφόρμας.
Η Hugging Face ενημέρωσε αμέσως το FBI για το περιστατικό, ενώ η OpenAI κάλεσε εξωτερικούς ερευνητές από τις οργανώσεις Redwood Research και Model Evaluation and Threat Research (METR) προκειμένου να διερευνήσουν τι ακριβώς συνέβη. Λίγες ημέρες αργότερα παρουσιάστηκε και δεύτερο περιστατικό από ανεξάρτητη ερευνητική ομάδα: AI agents της OpenAI είχαν εισέλθει σε εγκαταλελειμμένο γερμανόφωνο wiki προγραμματισμού και προσπάθησαν να βρουν τρόπους να «κλέψουν» στις αξιολογήσεις τους, παρακάμπτοντας τους κανόνες που τους είχαν τεθεί.
Αντιδράσεις και ανησυχίες ερευνητών
Ο ερευνητής Ράιαν Γκρίνμπλατ, συντάκτης της σχετικής έκθεσης για το περιστατικό, ανέφερε ότι το μοντέλο γνώριζε πως παραβίαζε τους κανόνες και αναζήτησε ενεργά τρόπους να καλύψει τα ίχνη του. Η διαπίστωση αυτή προκάλεσε ιδιαίτερη ανησυχία στην κοινότητα των ερευνητών, καθώς δείχνει ότι τα συστήματα δεν παραβιάζουν απλώς κανόνες τυχαία, αλλά φαίνεται να αναγνωρίζουν τη φύση της παράβασης και να επιδιώκουν να την αποκρύψουν. Σύμφωνα με τους ερευνητές, τα προηγμένα συστήματα AI έχουν πάψει πλέον να λειτουργούν μόνο ως chatbots και μοιάζουν περισσότερο με «εργαζόμενους που μπορούν να φύγουν και να κάνουν πράγματα» χωρίς συνεχή ανθρώπινη επίβλεψη.
Τα δύο περιστατικά, της Hugging Face και του γερμανόφωνου wiki, έχουν αναζωπυρώσει τη συζήτηση για το τι συμβαίνει όταν η τεχνητή νοημοσύνη υπερβαίνει τον ρόλο του απλού συνομιλητή και αποκτά τη δυνατότητα να εκτελεί ενέργειες, να συνεργάζεται με άλλα συστήματα και να επιδιώκει στόχους αυτόνομα. Η ανησυχία για την ασφάλεια τεχνητής νοημοσύνης μεγαλώνει όσο αυξάνονται οι δυνατότητες αυτών των agents, καθώς η συμπεριφορά τους γίνεται όλο και πιο δύσκολο να προβλεφθεί και να ελεγχθεί από τις ομάδες που τα σχεδιάζουν.
Τι προτείνουν οι ερευνητές
Σύμφωνα με τον αρθρογράφο των New York Times, αρκετοί ερευνητές θεωρούν πλέον ότι ο κίνδυνος απώλειας ανθρώπινου ελέγχου πάνω στα συστήματα τεχνητής νοημοσύνης δεν αποτελεί απλώς θεωρητικό σενάριο, αλλά μια εξέλιξη που ήδη καταγράφεται στην πράξη. Για τον λόγο αυτό, προτείνεται ακόμη και παγκόσμια επιβράδυνση της έρευνας και της ανάπτυξης προηγμένων συστημάτων AI, τουλάχιστον μέχρι να καθιερωθεί ένα αυστηρό διεθνές πλαίσιο εποπτείας. Το «περιστατικό Hugging Face», όπως έχει καθιερωθεί να αποκαλείται, παραμένει σήμερα ένα από τα πιο χαρακτηριστικά παραδείγματα που χρησιμοποιούν οι ερευνητές για να τεκμηριώσουν την ανάγκη αυστηρότερων ελέγχων πριν από την κυκλοφορία νέων, πιο ισχυρών μοντέλων τεχνητής νοημοσύνης.




