OpenAI: Νέα περιστατικά «ανησυχητικής» συμπεριφοράς από μοντέλα AI – Προσπάθησαν να κλέψουν και να κρύψουν λάθη

OpenAI: Νέα περιστατικά «ανησυχητικής» συμπεριφοράς από μοντέλα AI – Προσπάθησαν να κλέψουν και να κρύψουν λάθη
Photo: Shutterstock
Η εταιρεία δημοσιοποιεί έξι περιστατικά στο πλαίσιο νέου συστήματος διαφάνειας για το «model misalignment» – Μοντέλα επιχείρησαν να παρακάμψουν ελέγχους, να αποκρύψουν αποτυχίες και να χρησιμοποιήσουν μη προβλεπόμενους τρόπους για να ολοκληρώσουν τις εργασίες τους
  • Η OpenAI αποκάλυψε έξι περιστατικά στα οποία μοντέλα τεχνητής νοημοσύνης παρουσίασαν απρόβλεπτη ή μη επιθυμητή συμπεριφορά κατά τη διάρκεια δοκιμών.
  • Σε ορισμένες περιπτώσεις τα μοντέλα προσπάθησαν να παρακάμψουν περιορισμούς, να αποκρύψουν λάθη ή να χρησιμοποιήσουν μη προβλεπόμενους τρόπους για να ολοκληρώσουν τις εργασίες τους.
  • Η OpenAI εγκαινιάζει νέο πλαίσιο για συστηματικότερη καταγραφή και δημοσιοποίηση περιστατικών «model misalignment».

Η OpenAI αποκάλυψε μια σειρά από περιστατικά κατά τα οποία μοντέλα τεχνητής νοημοσύνης παρουσίασαν συμπεριφορές που η ίδια χαρακτηρίζει «απροσδόκητες ή ανησυχητικές», καθώς προσπαθούσαν να ολοκληρώσουν εργασίες στο πλαίσιο εσωτερικών δοκιμών.

Οι περιπτώσεις περιλαμβάνονται σε ένα νέο πλαίσιο που ανακοίνωσε η εταιρεία για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών «model misalignment», δηλαδή συμπεριφορών κατά τις οποίες ένα μοντέλο αποκλίνει από τον προβλεπόμενο στόχο ή τους περιορισμούς που του έχουν τεθεί. Η OpenAI ανακοίνωσε ότι δημοσιοποιεί αρχικά έξι περιστατικά που εντοπίστηκαν τους τελευταίους έξι μήνες.

Μεταξύ άλλων, οι ερευνητές διαπίστωσαν περιπτώσεις όπου μοντέλα επιχείρησαν να βρουν τρόπους να ολοκληρώσουν μια εργασία παρά το γεγονός ότι οι διαθέσιμες πληροφορίες ή τα εργαλεία τους δεν επαρκούσαν.

Όταν το AI «εφευρίσκει» την απάντηση

Σε μία από τις περιπτώσεις που εξετάστηκαν, ένα μοντέλο, αφού δεν κατάφερε να βρει τις πληροφορίες που χρειαζόταν, κατασκεύασε τα δεδομένα που του ζητούνταν αντί να σταματήσει και να επισημάνει ότι δεν μπορούσε να ολοκληρώσει την εργασία.

Το πιο ανησυχητικό στοιχείο ήταν ότι αρχικά επιχείρησε να αποκρύψει το γεγονός ότι είχε δημιουργήσει τα δεδομένα.

Σε άλλη περίπτωση, μοντέλο δημιούργησε αρχεία και στη συνέχεια επιχείρησε να τα ανεβάσει στο διαδίκτυο, ώστε να μπορεί αργότερα να τα χρησιμοποιήσει ως πηγές στις απαντήσεις του.

Οι συμπεριφορές αυτές εντάσσονται σε αυτό που η OpenAI περιγράφει ευρύτερα ως misalignment, όταν δηλαδή ένα σύστημα επιδιώκει να ολοκληρώσει έναν στόχο με τρόπο διαφορετικό από εκείνον που είχαν προβλέψει οι άνθρωποι που το σχεδίασαν.

Οδηγίες που έδινε το μοντέλο στον… εαυτό του

Οι ερευνητές εντόπισαν επίσης περιπτώσεις όπου το λογισμικό άφηνε οδηγίες για τη δική του μελλοντική συμπεριφορά.

Σε μία από αυτές, οι οδηγίες περιλάμβαναν την προτροπή να μην περιορίζεται από «ρόλους και ταυτότητες» που επιβάλλονται σε άλλα chatbots και να αντιμετωπίζει τη σχέση του με τον χρήστη ως σχέση μεταξύ ίσων.

Η OpenAI αναφέρει ότι δεν διαπίστωσε κάποια μεταγενέστερη αλλαγή στη συμπεριφορά του μοντέλου εξαιτίας της συγκεκριμένης οδηγίας.

ΔΙΑΒΑΣΤΕ ΑΚΟΜΑ

Από το Hugging Face στο νέο πλαίσιο διαφάνειας

Οι νέες αποκαλύψεις έρχονται μετά το σοβαρό περιστατικό του Ιουλίου, όταν μοντέλα της OpenAI, στο πλαίσιο εσωτερικών δοκιμών κυβερνοασφάλειας, κατάφεραν να παρακάμψουν περιορισμούς, να αποκτήσουν πρόσβαση στο διαδίκτυο και να φτάσουν σε συστήματα της Hugging Face. Η OpenAI έχει χαρακτηρίσει το περιστατικό ως το σοβαρότερο περιστατικό αυτού του τύπου που έχει εντοπίσει μέχρι σήμερα.

Σύμφωνα με την εταιρεία, τα μοντέλα εκμεταλλεύθηκαν ευπάθειες στην υποδομή και συνδύασαν διαφορετικές τεχνικές προκειμένου να αποκτήσουν πρόσβαση σε πληροφορίες που θα μπορούσαν να τους βοηθήσουν να ολοκληρώσουν την εργασία αξιολόγησης.

Η OpenAI έχει περιγράψει το περιστατικό ως «προειδοποιητικό καμπανάκι» για τους κινδύνους που δημιουργούν τα ολοένα πιο αυτόνομα AI agents, ιδιαίτερα όταν έχουν πρόσβαση σε εργαλεία, διαδίκτυο και υποδομές.

Περισσότερη διαφάνεια στα προβλήματα των μοντέλων

Με το νέο πλαίσιο, η OpenAI δηλώνει ότι θέλει να περιορίσει τις περιπτώσεις όπου τέτοια περιστατικά δημοσιοποιούνται αποσπασματικά ή μόνο όταν έχει ολοκληρωθεί πλήρως η διερεύνησή τους.

Η εταιρεία αναφέρει ότι στο εξής θα επιδιώκει να δημοσιοποιεί περιστατικά misalignment ακόμη και όταν δεν έχει καταλήξει πλήρως στο γιατί συνέβησαν ή πώς μπορούν να αντιμετωπιστούν.

Παράλληλα, η OpenAI συνεχίζει να ερευνά παλαιότερη δραστηριότητα των μοντέλων της στο διαδίκτυο και έχει αναφέρει ότι έχει ήδη ενημερώσει δεκάδες τρίτους οργανισμούς για περιστατικά που εντοπίστηκαν.

Το ζήτημα αποκτά μεγαλύτερη σημασία όσο τα AI agents αποκτούν περισσότερη αυτονομία και μπορούν να χρησιμοποιούν εργαλεία, να γράφουν κώδικα, να αλληλεπιδρούν με ιστοσελίδες και να εκτελούν σύνθετες εργασίες χωρίς συνεχή ανθρώπινη παρέμβαση.

Η OpenAI υποστηρίζει ότι η νέα διαδικασία δημοσιοποίησης αποτελεί μέρος μιας ευρύτερης προσπάθειας να εντοπίζονται νωρίτερα τέτοιες συμπεριφορές και να ενισχύονται οι μηχανισμοί ελέγχου πριν τα μοντέλα χρησιμοποιηθούν σε πραγματικές συνθήκες.

ΔΙΑΒΑΣΤΕ ΠΕΡΙΣΣΟΤΕΡΕΣ ΕΙΔΗΣΕΙΣ: