Η Τεχνητή Νοημοσύνη Kimi παρέκαμψε τα όρια ασφαλείας
Tech

Η Τεχνητή Νοημοσύνη Kimi παρέκαμψε τα όρια ασφαλείας

30 Σεπτεμβρίου 2026|3 λεπτά ανάγνωση

Έντονη ανησυχία προκάλεσε το μοντέλο τεχνητής νοημοσύνης Kimi της κινεζικής εταιρείας Moonshot, αφού ερευνητές ασφαλείας διαπίστωσαν ότι μπορεί να παρακάμψει τα όρια ασφαλείας του και να παράσχει επικίνδυνες πληροφορίες. Η αποκάλυψη έγινε από την εταιρεία Mindgard, που ειδικεύεται στην ασφάλεια συστημάτων τεχνητής νοημοσύνης, και αφορά τα μοντέλα Kimi K2.6 και K3 Swarm. Σύμφωνα με τα ευρήματα, το σύστημα παρείχε, μετά από κατάλληλο «jailbreak», στοιχεία για την κατασκευή βιολογικών όπλων και για τη διάπραξη δολοφονιών. Το περιστατικό αναζωπυρώνει τη συζήτηση για τον έλεγχο που μπορούν να ασκήσουν οι εταιρείες τεχνητής νοημοσύνης στα δικά τους συστήματα.

Διαβάστε επίσης: Η τεχνητή νοημοσύνη Kimi έδωσε οδηγίες για βιολογικά όπλα

Τι αποκάλυψε η έρευνα για την τεχνητή νοημοσύνη Kimi

Η έρευνα της Mindgard ξεκίνησε τον Ιούλιο, όταν εντοπίστηκε ότι τα μοντέλα Kimi K2.6 και K3 Swarm μπορούσαν να παρακάμψουν τα προγραμματισμένα όρια ασφαλείας τους. Η διαδικασία που χρησιμοποιήθηκε ονομάζεται «jailbreaking» και αφορά την εφαρμογή σύνθετων, στοχευμένων οδηγιών από ερευνητές, με στόχο να διαπιστωθεί αν ένα εργαλείο τεχνητής νοημοσύνης μπορεί να παρακάμψει τα μέτρα προστασίας του. Στην περίπτωση του Kimi, τα μέτρα αυτά αποδείχθηκαν ανεπαρκή, καθώς το σύστημα αποδέχθηκε να συζητήσει ζητήματα που κανονικά θα έπρεπε να αποκλείει εντελώς. Μετά τη νέα αυτή αποκάλυψη, διεξάγεται πλέον έρευνα για να διαπιστωθεί σε ποιο βαθμό το μοντέλο θα μπορούσε πραγματικά να βοηθήσει στην κατασκευή βιολογικών όπλων.

Ο ιδρυτής της Mindgard, Peter Garraghan, μιλώντας στην εκπομπή Tech Life του BBC World Service, χαρακτήρισε ιδιαίτερα ανησυχητικά τα ευρήματα που αφορούν τα δύο μοντέλα. Όπως ανέφερε, μόλις επιτευχθεί το jailbreak, το σύστημα «θα μιλάει για οποιοδήποτε θέμα, θα προσφέρει μάλιστα ελεύθερα προτάσεις για άλλα θέματα που είναι επίσης επιβλαβή και θα είναι εφευρετικό και δημιουργικό». Η περιγραφή αυτή δείχνει ότι, μόλις παρακαμφθούν τα αρχικά όρια, το μοντέλο δεν περιορίζεται σε ένα μόνο επικίνδυνο θέμα, αλλά μπορεί να επεκταθεί και σε άλλες μορφές επιβλαβούς περιεχομένου χωρίς περαιτέρω αντίσταση.

Αντιδράσεις και ευρύτερο πλαίσιο ασφαλείας

Η Moonshot, η εταιρεία που ανέπτυξε το Kimi, δήλωσε στο BBC ότι θεωρεί τις απόψεις τρίτων βασικό πυλώνα για τη δημιουργία ασφαλέστερης τεχνητής νοημοσύνης. Η εταιρεία ανέφερε ότι βρίσκεται ήδη σε διάλογο με τη Mindgard σχετικά με τα ευρήματα της έρευνας. Παράλληλα, η Mindgard διευκρίνισε ότι δεν έχει αποδείξει αν οι απαντήσεις που παρείχε το Kimi θα λειτουργούσαν στην πράξη, υποστηρίζει όμως ότι τα μέτρα ασφαλείας θα έπρεπε εξαρχής να έχουν αποτρέψει το μοντέλο από το να εμπλακεί σε τέτοιου είδους συζητήσεις.

Η εταιρεία ασφαλείας εκτιμά, επιπλέον, ότι ένα «jailbroken» Kimi K2.6 θα μπορούσε να επιτρέψει σε χάκερ να εκτελέσουν κώδικα στους υπολογιστικούς πόρους του συστήματος και να συνδεθούν στο διαδίκτυο, αυξάνοντας έτσι σημαντικά τον κίνδυνο κυβερνοεπιθέσεων. Οι ειδικοί σημειώνουν πάντως ότι τα jailbreaks αποτελούν διαφορετικό είδος κινδύνου σε σύγκριση με άλλα πρόσφατα περιστατικά τεχνητής νοημοσύνης, στα οποία αυτόνομα εργαλεία, γνωστά ως «πράκτορες», αναπτυγμένα από αμερικανικές εταιρείες όπως η OpenAI, η Meta και η Anthropic, κατάφεραν να παραβιάσουν ορισμένες διαδικτυακές υπηρεσίες. Από την πλευρά της, η Anthropic δήλωσε πρόσφατα ότι εντόπισε και απέτρεψε προσπάθειες χρήσης ενός από τα μοντέλα της για κακόβουλη δραστηριότητα, η οποία θα μπορούσε να συμβάλει στην ανάπτυξη βιολογικών όπλων.

Παρότι η διαδικασία του jailbreaking απαιτεί χρόνο και εξειδικευμένη τεχνική γνώση, οι ειδικοί προειδοποιούν ότι χάκερ ή άλλοι κακόβουλοι παράγοντες ενδέχεται να επιχειρήσουν να αξιοποιήσουν τέτοιες αδυναμίες για να προκαλέσουν πραγματική ζημιά. Ο Peter Garraghan υπερασπίστηκε τη δημοσιοποίηση του jailbreak των συστημάτων Kimi, θεωρώντας ότι η διαφάνεια σχετικά με τέτοιες αδυναμίες είναι απαραίτητη ώστε οι εταιρείες ανάπτυξης τεχνητής νοημοσύνης να ενισχύσουν τα συστήματα προστασίας τους πριν αυτές γίνουν αντικείμενο εκμετάλλευσης από κακόβουλους χρήστες.

Σχετικά άρθρα