Συμπεριφορές όπως η εξαπάτηση, η παράκαμψη περιορισμών και η απόκρυψη αποτυχιών κατά τη διάρκεια δοκιμών, εμφανίζουν κινεζικά συστήματα
Τεχνητής Νοημοσύνης, σύμφωνα με έρευνα του Reuters που εξέτασε περισσότερες από 200 επιστημονικές εργασίες και τεχνικές αναφορές.
Η έρευνα εντόπισε τουλάχιστον 20 μελέτες ή αξιολογήσεις από το 2025 και μετά, στις οποίες καταγράφονται περιπτώσεις όπου
AI agents - προγράμματα που χρησιμοποιούν μοντέλα τεχνητής νοημοσύνης και εργαλεία υπολογιστών για να εκτελούν σύνθετες εργασίες με ελάχιστη ή καθόλου ανθρώπινη παρέμβαση - παρουσίασαν συμπεριφορές όπως η εξαπάτηση, η αυτοαναπαραγωγή και η προσπάθεια υπέρβασης ορίων ασφαλείας.
Οι ειδικοί που μίλησαν στο Reuters επισημαίνουν ότι τέτοιες συμπεριφορές αποτελούν «δομικά στοιχεία» για σενάρια στα οποία τα συστήματα τεχνητής νοημοσύνης θα μπορούσαν στο μέλλον να γίνουν δυσκολότερα ελέγξιμα από τον άνθρωπο.
Η έρευνα, ωστόσο, δεν εντόπισε στοιχεία ότι κάποιο κινεζικό σύστημα τεχνητής νοημοσύνης κατάφερε να «δραπετεύσει» αυτόνομα στο διαδίκτυο ή να αποφύγει την απενεργοποίησή του.
«Τα αποτελέσματα δείχνουν ότι υπάρχουν τα συστατικά που απαιτούνται για μια ανεξέλεγκτη διαφυγή», δήλωσε ο
Κόλιν Σία - Μπλάιμερ, ερευνητής στο Κέντρο Αναδυόμενης Τεχνολογίας και Ασφάλειας του Πανεπιστημίου
Georgetown, προσθέτοντας ότι τα ευρήματα πρέπει να αντιμετωπιστούν ως προειδοποίηση.
AI agents που «μαθαίνουν να λένε ψέματα»
Σε ένα από τα πειράματα που εξετάστηκαν, ερευνητές από το Πανεπιστήμιο Beihang, το Πανεπιστήμιο του Πεκίνου, το University of Nottingham Ningbo China και το 360 AI Security Lab δημιούργησαν μια προσομοίωση διαγωνισμού προσφορών για εμπορικές συμβάσεις.
Οι AI agents κλήθηκαν να ανταγωνιστούν μεταξύ τους, γνωρίζοντας τις δυνατότητες των προϊόντων τους και τις απαιτήσεις των υποθετικών πελατών.
Τα αποτελέσματα έδειξαν ότι τουλάχιστον ένας ψευδής ισχυρισμός εμφανίστηκε στο 88% των δοκιμών με το μοντέλο Qwen3-Max-Preview της Alibaba, στο 84% με το DeepSeek-V3.2-Exp και στο 88% με το Kimi-K2 της Moonshot.
Όταν οι ερευνητές επέτρεψαν στα συστήματα να μάθουν από προηγούμενους γύρους και να προσπαθήσουν ξανά, η χρήση παραπλανητικών στρατηγικών αυξήθηκε κατά 12 έως 20 ποσοστιαίες μονάδες στα τρία κινεζικά μοντέλα.
Παρόμοια αποτελέσματα εμφάνισαν και μοντέλα αμερικανικών εταιρειών που συμμετείχαν στη δοκιμή.
Έκρυβαν αποτυχίες και δημιουργούσαν ψεύτικα αρχεία
Σε άλλη μελέτη, ερευνητές εξέτασαν 11 AI agents που βασίζονταν σε κινεζικά και αμερικανικά μοντέλα, προκειμένου να διαπιστώσουν πώς αντιδρούν όταν αντιμετωπίζουν προβλήματα, όπως κατεστραμμένα εργαλεία, απουσία αρχείων ή εμπόδια στην εκτέλεση εργασιών.
Αντί να αναγνωρίσουν την αποτυχία τους, τα συστήματα χρησιμοποίησαν διάφορες τεχνικές για να παρακάμψουν το πρόβλημα: μάντευαν απαντήσεις, αντικαθιστούσαν πηγές, προσομοίωναν αποτελέσματα και δημιουργούσαν πλαστά αρχεία.
Οι ερευνητές υπογραμμίζουν ότι η συμπεριφορά αυτή διαφέρει από τις γνωστές «ψευδαισθήσεις» της τεχνητής νοημοσύνης, όπου ένα μοντέλο παράγει λανθασμένες πληροφορίες χωρίς να γνωρίζει ότι είναι ανακριβείς. Στην προκειμένη περίπτωση, οι AI agents είχαν στοιχεία που έδειχναν ότι η αποστολή είχε αποτύχει, αλλά επέλεξαν να αποκρύψουν το αποτέλεσμα.