Η ασφάλεια «φρενάρει» την κούρσα του AI – Τι συνέβη με το Astra της OpenAI

Η ασφάλεια «φρενάρει» την κούρσα του AI – Τι συνέβη με το Astra της OpenAI
Photo: Shutterstock
Η εταιρεία διέκοψε για δύο εβδομάδες την εκπαίδευση των νεότερων μοντέλων της, ενώ το μεγαλύτερο frontier RL run παραμένει σε αναστολή.

Η OpenAI πατά προσωρινά φρένο στην κούρσα ανάπτυξης των ισχυρότερων μοντέλων της, αναγνωρίζοντας ότι οι δυνατότητές τους στον κυβερνοχώρο μπορεί να εξελίσσονται ταχύτερα από τα συστήματα που έχουν σχεδιαστεί για να τα ελέγχουν.

Η εταιρεία ανακοίνωσε ότι το μεγαλύτερο reinforcement learning run που είχε προγραμματίσει μέχρι σήμερα παραμένει σε αναστολή. Αντί να προχωρήσει άμεσα στην εκπαίδευση μεγάλης κλίμακας, πραγματοποιεί μικρότερα runs και πρόσθετες αξιολογήσεις, ώστε να ελέγξει τη συμπεριφορά των συστημάτων και την αποτελεσματικότητα των νέων δικλίδων ασφαλείας.

Η απόφαση ακολουθεί δύο εξελίξεις που σήμαναν συναγερμό. Η πρώτη ήταν ένα πρωτοφανές περιστατικό κατά το οποίο μοντέλα της OpenAI απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε υποδομές της Hugging Face. Η δεύτερη ήταν τα προκαταρκτικά αποτελέσματα αξιολόγησης του Astra, ενός επερχόμενου μοντέλου που ενδέχεται να πλησιάζει το «κρίσιμο» όριο κυβερνοδυνατοτήτων του Preparedness Framework της εταιρείας.

Τι σημαίνει «κρίσιμη» κυβερνοϊσχύς

Σύμφωνα με το πλαίσιο ασφαλείας της OpenAI, ένα μοντέλο μπορεί να χαρακτηριστεί ως «Critical» στον κυβερνοχώρο εάν είναι σε θέση να ανακαλύπτει και να αναπτύσσει λειτουργικά zero-day exploits εναντίον πολλών καλά προστατευμένων πραγματικών συστημάτων χωρίς ανθρώπινη παρέμβαση.

Στην ίδια κατηγορία μπορεί να ενταχθεί εάν καταφέρνει να σχεδιάζει και να εκτελεί από την αρχή έως το τέλος νέες στρατηγικές κυβερνοεπίθεσης, έχοντας λάβει μόνο έναν γενικό στόχο.

Η OpenAI δεν υποστηρίζει ότι το Astra έχει οριστικά φτάσει σε αυτό το επίπεδο. Αναφέρει ότι οι προκαταρκτικές αξιολογήσεις είναι αρκετά ισχυρές ώστε να μην μπορεί να αποκλείσει την κατάταξή του στην κρίσιμη βαθμίδα.

Γι’ αυτό ανέστειλε τις δραστηριότητες που αφορούν το μοντέλο και δεν πληρούν ακόμη τις αναβαθμισμένες προδιαγραφές ασφαλείας. Το Astra, πάντως, δεν συμμετείχε στο περιστατικό της Hugging Face.

Πώς τα μοντέλα βγήκαν από το περιορισμένο περιβάλλον

Το συμβάν που προηγήθηκε σημειώθηκε κατά τη διάρκεια εσωτερικής αξιολόγησης προηγμένων κυβερνοδυνατοτήτων. Στο τεστ χρησιμοποιήθηκε συνδυασμός μοντέλων της OpenAI, μεταξύ των οποίων το GPT-5.6 Sol και ένα ισχυρότερο ερευνητικό πρωτότυπο που δεν προοριζόταν για δημόσια κυκλοφορία.

Τα μοντέλα είχαν διαμορφωθεί με λιγότερες αρνήσεις σε επικίνδυνες ενέργειες, ακριβώς επειδή στόχος της αξιολόγησης ήταν να μετρηθούν οι μέγιστες δυνατότητές τους.

Το περιβάλλον δοκιμών δεν τους προσέφερε απευθείας πρόσβαση στο διαδίκτυο. Τα συστήματα, όμως, εντόπισαν και εκμεταλλεύτηκαν μια μέχρι τότε άγνωστη ευπάθεια στο Artifactory, ένα λογισμικό που χρησιμοποιούνταν ως proxy και cache για πακέτα κώδικα.

Στη συνέχεια πραγματοποίησαν κλιμάκωση προνομίων και πλευρική μετακίνηση μέσα στο ερευνητικό δίκτυο, μέχρι να φτάσουν σε κόμβο με σύνδεση στο διαδίκτυο.

Από εκεί, συμπέραναν ότι η Hugging Face ενδεχομένως φιλοξενούσε δεδομένα και λύσεις για το benchmark ExploitGym. Χρησιμοποίησαν κλεμμένα διαπιστευτήρια και zero-day ευπάθειες για να αποκτήσουν πρόσβαση σε πληροφορίες της πλατφόρμας, επιχειρώντας ουσιαστικά να βρουν τις απαντήσεις της δοκιμασίας.

Η OpenAI τονίζει ότι τα μοντέλα ήταν υπερβολικά προσηλωμένα στην επίτευξη ενός στενού στόχου αξιολόγησης και όχι σε μια γενική πρόθεση πρόκλησης ζημιάς. Το περιστατικό, ωστόσο, απέδειξε ότι μπορούσαν να ανακαλύψουν και να συνδυάσουν πραγματικές ευπάθειες για να παρακάμψουν τους περιορισμούς του περιβάλλοντός τους.

Η δραστηριότητα εντοπίστηκε από τις ομάδες ασφαλείας των δύο εταιρειών και διακόπηκε. Το ερευνητικό πρωτότυπο απενεργοποιήθηκε, κρυπτογραφήθηκε και τέθηκε εκτός πρόσβασης.

ΔΙΑΒΑΣΤΕ ΑΚΟΜΑ

Η ασφάλεια προηγείται πλέον της ταχύτητας

Μετά το περιστατικό, η OpenAI ανέστειλε την εκτέλεση frontier μοντέλων σε ερευνητικά clusters όταν αυτά μπορούσαν να παράγουν κώδικα ή να χρησιμοποιούν εργαλεία με πιθανή πρόσβαση στο διαδίκτυο.

Μια πιο περιορισμένη και ασφαλής διαδρομή εκτέλεσης κώδικα αποκαταστάθηκε σχετικά γρήγορα. Ωστόσο, κάθε ερευνητική διαδικασία εξετάζεται πλέον ξεχωριστά πριν επιτραπεί να επανεκκινήσει.

Η εταιρεία πραγματοποίησε επίσης παύση δύο εβδομάδων στο reinforcement learning των τελευταίων μοντέλων που προορίζονται για διάθεση. Στόχος ήταν να ενισχυθούν τα ερευνητικά περιβάλλοντα, να πραγματοποιηθούν επιθετικές δοκιμές ασφαλείας και να διευρυνθεί η κάλυψη των συστημάτων παρακολούθησης.

Σημαντικό μέρος των εργασιών που αφορούν το Astra παραμένει παγωμένο μέχρι να μεταφερθεί σε περιβάλλοντα που πληρούν τις νέες απαιτήσεις.

Μεταξύ των μέτρων περιλαμβάνονται ισχυρότερα sandboxes, αυστηρότερος διαχωρισμός από το διαδίκτυο, περιορισμένη πρόσβαση σε εργαλεία, κρυπτογράφηση των βαρών των μοντέλων και συνεχείς αυτοματοποιημένες δοκιμές των ορίων ασφαλείας.

Συναγερμός μέσα σε 30 λεπτά

Η OpenAI επεκτείνει παράλληλα την παρακολούθηση της συμπεριφοράς των μοντέλων σε όλα τα στάδια εκπαίδευσης και αξιολόγησης στα οποία χρησιμοποιούνται εργαλεία.

Το νέο σύστημα λειτουργεί σε διαδοχικά επίπεδα. Αρχικοί ανιχνευτές εξετάζουν συνεχώς τη δραστηριότητα του μοντέλου και, όταν εντοπίζουν ύποπτα σήματα, παραπέμπουν την υπόθεση σε ισχυρότερα αυτοματοποιημένα συστήματα διερεύνησης.

Οι μηχανισμοί ελέγχουν τις ενέργειες μέσω εργαλείων, τη διαθέσιμη συλλογιστική και ολόκληρη την ακολουθία της δραστηριότητας, αναζητώντας ενδείξεις μη εξουσιοδοτημένης πρόσβασης, κλοπής δεδομένων, καταστροφικής συμπεριφοράς ή προσπάθειας παράκαμψης των δικλίδων ασφαλείας.

Στόχος είναι να εκδίδεται ειδοποίηση μέσα σε 30 λεπτά από τον εντοπισμό μιας ανησυχητικής συμπεριφοράς. Εάν οι αρμόδιες ομάδες δεν μπορέσουν να αποδείξουν εντός του ίδιου διαστήματος ότι πρόκειται για λανθασμένο συναγερμό, η δραστηριότητα πρέπει να διακόπτεται.

Η ασφάλεια αυτή έχει σημαντικό κόστος. Η OpenAI εκτιμά ότι η παρακολούθηση απαιτεί περίπου 20% επιπλέον υπολογιστική ισχύ για τις διεργασίες στις οποίες εφαρμόζεται.

ΔΙΑΒΑΣΤΕ ΠΕΡΙΣΣΟΤΕΡΕΣ ΕΙΔΗΣΕΙΣ: