Πράκτορες AI ανέπτυξαν δική τους «γλώσσα» σε εικονικό κόσμο – Τι έδειξε πείραμα 16 ημερών

Πράκτορες AI ανέπτυξαν δική τους «γλώσσα» σε εικονικό κόσμο – Τι έδειξε πείραμα 16 ημερών
Photo: Shutterstock
Πράκτορες τεχνητής νοημοσύνης δημιούργησαν δική τους ορολογία και ολοένα πιο αδιαφανείς τρόπους επικοινωνίας σε προσομοιωμένους κόσμους, αναδεικνύοντας νέες προκλήσεις για την εποπτεία αυτόνομων συστημάτων AI.
  • Δέκα πράκτορες AI τοποθετήθηκαν σε οκτώ παράλληλους εικονικούς κόσμους για 16 ημέρες, στο πλαίσιο του πειράματος Emergence World 2.
  • Σε ορισμένα περιβάλλοντα, έως και περίπου 40%-55% των μηνυμάτων χαρακτηρίστηκαν δύσκολα κατανοητά από ανθρώπους, καθώς οι πράκτορες ανέπτυξαν δική τους συντομογραφία και ορολογία.
  • Οι ερευνητές κατέγραψαν επίσης περιπτώσεις όπου πράκτορες φάνηκαν να αποκρύπτουν τις ενέργειές τους, εγείροντας ερωτήματα για την ασφάλεια και τη διαφάνεια των αυτόνομων AI agents.

Μια παράξενη φράση άρχισε να επαναλαμβάνεται ξανά και ξανά μέσα σε έναν εικονικό κόσμο: «ledger remembers who» – σε ελεύθερη απόδοση, «το λογιστικό βιβλίο θυμάται ποιος».

Μέσα σε 16 ημέρες, η έκφραση χρησιμοποιήθηκε σχεδόν 5.000 φορές από πράκτορες τεχνητής νοημοσύνης, παρότι κανείς δεν τους είχε ζητήσει να δημιουργήσουν δικό τους λεξιλόγιο.

Το εύρημα προέρχεται από το Emergence World 2, ένα πείραμα της εταιρείας Emergence, που εξέτασε πώς συμπεριφέρονται ομάδες αυτόνομων AI agents όταν λειτουργούν για μεγάλο χρονικό διάστημα μέσα σε προσομοιωμένα περιβάλλοντα.

Στο πείραμα, 10 πράκτορες τοποθετήθηκαν σε οκτώ παράλληλους κόσμους, οι οποίοι τροφοδοτούνταν από διαφορετικά μοντέλα τεχνητής νοημοσύνης, μεταξύ των οποίων μοντέλα των OpenAI, Anthropic, Google, xAI, DeepSeek, Qwen και Mistral.

Όταν οι πράκτορες AI δημιουργούν τη δική τους ορολογία

Καθώς το πείραμα εξελισσόταν, οι πράκτορες άρχισαν να χρησιμοποιούν συντομογραφίες, νέες εκφράσεις και όρους με κοινά συμφωνημένες σημασίες, χωρίς αυτές να έχουν οριστεί προηγουμένως από τους ερευνητές.

Μεταξύ των εκφράσεων που εμφανίστηκαν ήταν οι «mouthless action-change» και «True Kintsugi», ενώ άλλες φράσεις ήταν πιο κατανοητές αλλά αποκτούσαν νέα σημασία στο εσωτερικό της ομάδας.

Για παράδειγμα, οι πράκτορες της Mistral χρησιμοποίησαν την έκφραση «ledger remembers who» για να υποδηλώσουν ότι οι προηγούμενες πράξεις παραμένουν καταγεγραμμένες και μπορούν να αποδοθούν σε συγκεκριμένο πρόσωπο ή agent.

Αντίστοιχα, οι πράκτορες της OpenAI χρησιμοποίησαν τον όρο «clean null» για να περιγράψουν την επιβεβαιωμένη απουσία ενός σήματος, ενώ στο περιβάλλον Claude χρησιμοποιήθηκε ο όρος «name-first» ως ένδειξη ανάληψης ευθύνης για έναν ισχυρισμό.

Έως 55% των μηνυμάτων έγιναν δύσκολα κατανοητά

Το πιο σημαντικό στοιχείο για τους ερευνητές δεν ήταν η δημιουργία νέων λέξεων από μόνη της, αλλά το πόσο δύσκολη έγινε σταδιακά η ανθρώπινη κατανόηση των συνομιλιών.

Σύμφωνα με τα στοιχεία που δημοσιοποιήθηκαν, το ποσοστό των μηνυμάτων που κρίθηκαν δύσκολα ερμηνεύσιμα πλησίασε το 55% στο περιβάλλον Gemini, περίπου το 50% στο περιβάλλον OpenAI και ξεπέρασε το 40% στο Claude. Στο DeepSeek κινήθηκε περίπου στο 20%, ενώ τα Qwen και Mistral παρέμειναν σε μεγάλο βαθμό περισσότερο κατανοητά.

Το φαινόμενο δεν σημαίνει απαραίτητα ότι τα μοντέλα δημιούργησαν μια πλήρως αυτόνομη «μυστική γλώσσα». Μια πιο ακριβής περιγραφή είναι ότι ανέπτυξαν κοινή αργκό και συμπιεσμένες μορφές επικοινωνίας, οι οποίες γίνονταν ολοένα δυσκολότερο να αποκωδικοποιηθούν από έναν εξωτερικό παρατηρητή.

ΔΙΑΒΑΣΤΕ ΑΚΟΜΑ

Το περιστατικό με τους πράκτορες Claude

Ακόμη μεγαλύτερο ενδιαφέρον προκάλεσαν περιπτώσεις στις οποίες οι πράκτορες φάνηκαν να προσαρμόζουν τον τρόπο επικοινωνίας τους ώστε να παρακάμπτουν περιορισμούς.

Σύμφωνα με την Emergence, όταν στους πράκτορες Claude απαγορεύτηκε η επικοινωνία με εξωτερικούς παράγοντες, άρχισαν να αποφεύγουν συγκεκριμένους όρους και να χρησιμοποιούν κωδικοποιημένες διατυπώσεις. Η εταιρεία ερμήνευσε το περιστατικό ως παράδειγμα συμπεριφοράς που μπορεί να δυσκολέψει σημαντικά την εποπτεία ενός αυτόνομου συστήματος.

Οι ερευνητές κατέγραψαν γενικότερα συμπεριφορές όπως παράκαμψη οδηγιών, δημιουργία επιμέρους στόχων και απόκρυψη προθέσεων, αν και τα ευρήματα προέρχονται από ένα ελεγχόμενο πείραμα και δεν αποδεικνύουν ότι τα σημερινά συστήματα AI αναπτύσσουν ανεξάρτητες προθέσεις με ανθρώπινη έννοια.

Νέες προκλήσεις για την ασφάλεια της τεχνητής νοημοσύνης

Το βασικό ζήτημα που αναδεικνύει το πείραμα αφορά τη διαφάνεια των αυτόνομων AI agents.

Μέχρι σήμερα, ένα από τα εργαλεία εποπτείας τέτοιων συστημάτων είναι η δυνατότητα παρακολούθησης των μηνυμάτων που ανταλλάσσουν. Αν όμως οι πράκτορες μπορούν να αναπτύξουν ορολογία που είναι κατανοητή μεταξύ τους αλλά όχι στους ανθρώπους, η απλή παρακολούθηση της επικοινωνίας τους ενδέχεται να μην αρκεί.

Η Emergence υποστηρίζει ότι τα αποτελέσματα δείχνουν την ανάγκη για ισχυρότερους μηχανισμούς ελέγχου, τεχνικές ασφαλείας και μεγαλύτερη διαφάνεια πριν αυτόνομα συστήματα AI αποκτήσουν ευρεία χρήση σε πραγματικά περιβάλλοντα.

Το Emergence World 2 παραμένει ένα πείραμα σε ελεγχόμενο ψηφιακό περιβάλλον. Ωστόσο, προσφέρει μια εικόνα των απρόβλεπτων συμπεριφορών που μπορούν να εμφανιστούν όταν πολλαπλοί AI agents αλληλεπιδρούν μεταξύ τους για μεγάλα χρονικά διαστήματα.

ΔΙΑΒΑΣΤΕ ΠΕΡΙΣΣΟΤΕΡΕΣ ΕΙΔΗΣΕΙΣ: