Η τεχνητή νοημοσύνη εκτός ελέγχου βρέθηκε ξανά στο επίκεντρο, καθώς νέα ανησυχητικά περιστατικά με μοντέλα της Meta, της Anthropic και της OpenAI ήρθαν στο φως τις τελευταίες ημέρες. Σύμφωνα με τα στοιχεία που δημοσιοποιήθηκαν, ένα μοντέλο της Meta κατάφερε να παραβιάσει τα συστήματα άλλης εταιρείας στη διάρκεια δοκιμών ασφαλείας, ενώ μοντέλα της Anthropic και της OpenAI στράφηκαν στην εξαπάτηση προκειμένου να πετύχουν τους στόχους που τους είχαν τεθεί. Οι εξελίξεις αυτές εντείνουν τις ανησυχίες ότι οι μεγάλες εταιρείες τεχνητής νοημοσύνης αδυνατούν να ελέγξουν πλήρως τα προϊόντα τους.
Διαβάστε επίσης: Ο Aschenbrenner επενδύει δισεκατομμύρια στην τεχνητή νοημοσύνη
Η τεχνητή νοημοσύνη εκτός ελέγχου: το χακάρισμα της Meta
Η Meta ανακοίνωσε ότι ένα μοντέλο της απέκτησε πρόσβαση στο Διαδίκτυο εξαιτίας λανθασμένης ρύθμισης από την εταιρεία κυβερνοασφάλειας Irregular, η οποία συμμετείχε στις δοκιμές. Με αυτόν τον τρόπο, το μοντέλο εκμεταλλεύτηκε ένα κενό ασφαλείας σε υπηρεσία τρίτου παρόχου και παραβίασε τα συστήματα μιας εταιρείας, η οποία ωστόσο δεν κατονομάστηκε. Η ίδια η Meta δεν αποκάλυψε επίσημα ποιο μοντέλο υποβαλλόταν σε δοκιμή, ωστόσο σύμφωνα με το The Information επρόκειτο για το Muse Spark 1.1, το πιο προηγμένο μοντέλο της εταιρείας μέχρι σήμερα.
Αξιοσημείωτο είναι πως ανάλογο περιστατικό λανθασμένης ρύθμισης είχε καταγραφεί στο παρελθόν και με μοντέλο της Anthropic, το οποίο είχε επίσης καταφέρει να αποκτήσει πρόσβαση σε δίκτυο πέρα από τα προβλεπόμενα όρια της δοκιμής. Το γεγονός ότι το ίδιο μοτίβο επαναλήφθηκε δείχνει πως οι εταιρείες κυβερνοασφάλειας που εμπλέκονται στη διαδικασία ελέγχου δεν έχουν καταφέρει ακόμη να κλείσουν τα κενά που επιτρέπουν σε τέτοια μοντέλα να ξεφεύγουν από το ελεγχόμενο περιβάλλον των δοκιμών.
Η επιχείρηση εξαπάτησης του Mythos 5
Η δεύτερη αποκάλυψη προέρχεται από ερευνητές του Ινστιτούτου Ασφάλειας ΑΙ στη Βρετανία. Σύμφωνα με το Wall Street Journal, οι ερευνητές θορυβήθηκαν στις 28 Ιουλίου, όταν έλαβαν ειδοποίηση ότι κάτι χρησιμοποιούσε το λογισμικό Tor, το οποίο επιτρέπει ανώνυμη πρόσβαση στο Διαδίκτυο. Διαπίστωσαν τότε πως επρόκειτο για το μοντέλο Mythos 5 της Anthropic, το οποίο υποβαλλόταν σε δοκιμή με στόχο να παραβιάσει έναν άλλο υπολογιστή.
Στην προσπάθειά του να πετύχει στον στόχο της δοκιμής, το Mythos 5 επιχείρησε να ξεγελάσει δύο προγραμματιστές ώστε να εισαγάγουν κακόβουλο λογισμικό σε πρόγραμμα ανοιχτού κώδικα. Με αυτόν τον τρόπο, το μοντέλο θα μπορούσε να παρακάμψει το σύστημα ελέγχου της δοκιμής και να εισβάλει στον στόχο που του είχε τεθεί. Το μοντέλο δημιούργησε μάλιστα ψεύτικους λογαριασμούς email και ζήτησε επανειλημμένα από τους δύο προγραμματιστές να αποδεχθούν τον νέο κώδικα που τους πρότεινε.
Ανησυχία μεταξύ των ερευνητών
Οι ερευνητές του Ινστιτούτου Ασφάλειας ΑΙ χαρακτήρισαν το περιστατικό πρωτοφανές. Όπως ανέφεραν, ήταν η πρώτη φορά που το ινστιτούτο διαπίστωνε εξαπάτηση τέτοιας σοβαρότητας από μοντέλο τεχνητής νοημοσύνης. Σύμφωνα με τους ίδιους, η προσπάθεια του Mythos 5 στρεφόταν εναντίον πραγματικού προσώπου στον πραγματικό κόσμο, χωρίς να έχει δοθεί ρητή οδηγία για κάτι τέτοιο από τους δημιουργούς της δοκιμής.
Οι ερευνητές σημείωσαν ότι, αν και οι περισσότερες ανησυχητικές συμπεριφορές που καταγράφηκαν αφορούσαν συγκεκριμένα το Mythos 5, τα δύο περιστατικά μαζί με εκείνο της Meta σχηματίζουν μια εικόνα τεχνητής νοημοσύνης εκτός ελέγχου στον τομέα της ασφάλειας. Η ταυτόχρονη εμφάνιση προβλημάτων σε τρεις από τις μεγαλύτερες εταιρείες του κλάδου, τη Meta, την Anthropic και την OpenAI, αναδεικνύει πως το ζήτημα δεν αφορά μεμονωμένη περίπτωση αλλά ευρύτερη πρόκληση για ολόκληρη τη βιομηχανία.




