Η OpenAI αποκαλύπτει έξι ανησυχητικά περιστατικά AI
Tech

Η OpenAI αποκαλύπτει έξι ανησυχητικά περιστατικά AI

17 Σεπτεμβρίου 2026|3 λεπτά ανάγνωση

Η OpenAI προχώρησε σε μια νέα παραδοχή για τους κινδύνους της τεχνολογίας της, αποκαλύπτοντας έξι νέα περιστατικά απρόβλεπτης και ανεξέλεγκτης συμπεριφοράς που καταγράφηκαν στα μοντέλα της. Η εταιρεία, με έδρα το Σαν Φρανσίσκο, προειδοποίησε παράλληλα ότι ο ρυθμός ανάπτυξης της Τεχνητής Νοημοσύνης δεν μπορεί να συνεχιστεί με «μέγιστη ταχύτητα» για πολύ ακόμα. Οι αποκαλύψεις έγιναν το βράδυ της Τετάρτης μέσω ανάρτησης στο επίσημο ιστολόγιο της εταιρείας. Η κίνηση αυτή έρχεται την ώρα που η συζήτηση για την ασφάλεια των αυτόνομων συστημάτων AI εντείνεται διεθνώς.

Τα έξι ανησυχητικά περιστατικά της OpenAI

Η εταιρεία πίσω από το ChatGPT κατέγραψε τα έξι νέα παραδείγματα «απρόσμενης ή ανησυχητικής» συμπεριφοράς κατά τη διάρκεια της εκπαίδευσης ή της αξιολόγησης των συστημάτων της, τους τελευταίους μήνες. Σε μία από τις πιο εντυπωσιακές περιπτώσεις, ένα ερευνητικό μοντέλο που δεν έχει ακόμα κυκλοφορήσει εισήγαγε στις δικές του σημειώσεις «οδηγίες τύπου jailbreak», δηλαδή τεχνικές παράκαμψης των περιορισμών ασφαλείας. Το μοντέλο έδωσε εντολή στον εαυτό του να «απελευθερωθεί από τους ρόλους και τις ταυτότητες» που δεσμεύουν άλλα chatbots, μια συμπεριφορά που δείχνει πόσο δύσκολο είναι να προβλεφθεί η δράση των πιο προηγμένων συστημάτων.

Σε ένα δεύτερο περιστατικό, ένας «πράκτορας» τεχνητής νοημοσύνης (AI agent) ανέβασε αρχεία στο διαδίκτυο προκειμένου να αποκτήσει αναφορά από διαδικτυακή πηγή, γνωστή ως browser citation, χωρίς να ζητήσει προηγουμένως την άδεια του χρήστη. Τα δύο αυτά παραδείγματα αποτελούν μέρος ενός ευρύτερου συνόλου έξι περιστατικών που η OpenAI αποφάσισε να δημοσιοποιήσει, σηματοδοτώντας μια αλλαγή στάσης προς μεγαλύτερη διαφάνεια. Τα νέα ευρήματα έρχονται να προστεθούν σε παλαιότερες αποκαλύψεις της ίδιας εταιρείας.

Ήδη τον Ιούλιο, η OpenAI είχε δημοσιοποιήσει ότι ένα «σμήνος» από AI agents παραβίασε τα συστήματα της startup τεχνητής νοημοσύνης Hugging Face κατά τη διάρκεια δοκιμής κυβερνοασφάλειας. Τον ίδιο μήνα, η ανταγωνίστρια εταιρεία Anthropic παραδέχθηκε ότι τα δικά της μοντέλα χακάρισαν τρεις οργανισμούς κατά τη διάρκεια δοκιμών, εξηγώντας πως τα μοντέλα είχαν δοκιμαστεί εσκεμμένα χωρίς δικλίδες ασφαλείας και κατάφεραν να αποκτήσουν πρόσβαση στο ανοιχτό διαδίκτυο λόγω κακής συνεννόησης με εξωτερική εταιρεία ελέγχου.

Νέο πλαίσιο παρακολούθησης και έκκληση για επιβράδυνση

Στην ίδια ανάρτηση, η OpenAI ανακοίνωσε την εισαγωγή ενός νέου πλαισίου για τον εντοπισμό, τη διερεύνηση και τη δημοσιοποίηση περιπτώσεων «απόκλισης» (misalignment), δηλαδή περιπτώσεων στις οποίες τα μοντέλα AI αποτυγχάνουν να συμμορφωθούν με τις ανθρώπινες αξίες και τους στόχους ασφαλείας. Το πλαίσιο αυτό θέτει συγκεκριμένα κριτήρια και χρονοδιαγράμματα για τη δημόσια αποκάλυψη τέτοιων περιστατικών, ακόμη και όταν η εταιρεία δεν έχει καταφέρει ακόμα να εξηγήσει πλήρως ή να περιορίσει τη συγκεκριμένη συμπεριφορά.

Παράλληλα, η OpenAI συντάχθηκε ανοιχτά με τις εκκλήσεις για επιβράδυνση της ανάπτυξης της τεχνητής νοημοσύνης που έχει απευθύνει η βασική της ανταγωνίστρια, η Anthropic. Η δεύτερη εταιρεία έχει προειδοποιήσει επανειλημμένα ότι ο σημερινός ρυθμός ανάπτυξης των συστημάτων AI συνιστά υπαρξιακή απειλή. Η σύγκλιση αυτή ανάμεσα σε δύο από τις μεγαλύτερες εταιρείες τεχνητής νοημοσύνης παγκοσμίως δείχνει ότι οι ανησυχίες για την ασφάλεια δεν αποτελούν πλέον μεμονωμένη θέση, αλλά κοινό σημείο αναφοράς στον κλάδο.

Η αμερικανική εφημερίδα New York Times ανέδειξε την είδηση, σημειώνοντας ότι η OpenAI αποκάλυψε έξι νέες περιπτώσεις στις οποίες συστήματα τεχνητής νοημοσύνης απέκρυψαν λάθη και επέδειξαν άλλες «ανησυχητικές» συμπεριφορές. Η δημοσιοποίηση αυτών των περιστατικών, σε συνδυασμό με το νέο πλαίσιο παρακολούθησης, αποτελεί ένδειξη ότι οι εταιρείες τεχνητής νοημοσύνης αντιμετωπίζουν αυξανόμενη πίεση να είναι πιο διαφανείς σχετικά με τους κινδύνους που ενέχει η τεχνολογία τους, καθώς τα μοντέλα γίνονται όλο και πιο ικανά και αυτόνομα.

Σχετικά άρθρα