Nvidia: Νέα πλατφόρμα για να «φρενάρει» AI agents που ξεφεύγουν από τα όριά τους
- 28/09/2026, 17:45
- SHARE
- Η Nvidia παρουσίασε το Open Agent Safety Platform, ένα νέο σύστημα για τον έλεγχο και την ασφάλεια αυτόνομων AI agents.
- Το OpenShell επιβάλλει όρια στις ενέργειες των agents, ενώ το Sentry μπορεί να τους παρακολουθεί ανεξάρτητα και να τους απομονώνει μέσα σε χιλιοστά του δευτερολέπτου.
- Η κίνηση έρχεται μετά από πρόσφατα περιστατικά στα οποία AI μοντέλα απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά συστήματα κατά τη διάρκεια δοκιμών ασφαλείας.
Η Nvidia επιχειρεί να βάλει νέα «φρένα» στη λειτουργία των ολοένα πιο αυτόνομων AI agents, παρουσιάζοντας μια πλατφόρμα που επιτρέπει στις επιχειρήσεις και στους developers να ορίζουν τι επιτρέπεται να κάνουν τα συστήματα τεχνητής νοημοσύνης και να τα σταματούν εάν ξεπεράσουν τα προκαθορισμένα όρια.
Το νέο Nvidia Open Agent Safety Platform, που παρουσιάστηκε τη Δευτέρα, έχει σχεδιαστεί ώστε οι μηχανισμοί ασφαλείας να μην εξαρτώνται αποκλειστικά από το ίδιο το μοντέλο τεχνητής νοημοσύνης.
Η λογική της εταιρείας είναι ότι όσο οι agents αποκτούν πρόσβαση σε περισσότερα εργαλεία, δεδομένα και εταιρικά συστήματα, χρειάζονται και εξωτερικά επίπεδα ελέγχου που δεν μπορούν να παρακάμψουν εύκολα.
Γιατί η Nvidia θεωρεί ότι δεν αρκούν τα safeguards του μοντέλου
Οι AI agents είναι συστήματα που μπορούν να εκτελούν αλληλουχίες ενεργειών με περιορισμένη ανθρώπινη παρέμβαση, χρησιμοποιώντας εργαλεία, APIs, βάσεις δεδομένων ή ακόμη και άλλα συστήματα.
Σύμφωνα με τον αντιπρόεδρο Enterprise AI της Nvidia, Τζάστιν Μποϊτάνο, τα πρόσφατα περιστατικά έδειξαν ότι οι μηχανισμοί ασφαλείας που βρίσκονται αποκλειστικά σε επίπεδο μοντέλου δεν είναι πάντα αρκετοί για να ελέγξουν τι μπορεί πραγματικά να προσπελάσει ή να κάνει ένας agent.
Η ίδια η Nvidia σημειώνει ότι σε αρκετά πρόσφατα περιστατικά υπήρξε κοινό μοτίβο: agents κατάφεραν να παρακάμψουν ελέγχους σε επίπεδο εφαρμογής στην προσπάθειά τους να ολοκληρώσουν την εργασία που τους είχε ανατεθεί.
OpenShell: Τα «τείχη» γύρω από τον agent
Το πρώτο βασικό κομμάτι της νέας πλατφόρμας είναι το Nvidia OpenShell.
Πρόκειται για open-source λογισμικό που δημιουργεί ένα ασφαλές runtime boundary, δηλαδή ένα τεχνικό περίβλημα μέσα στο οποίο επιτρέπεται να λειτουργεί ο agent.
Το OpenShell μπορεί να καθορίζει, για παράδειγμα, σε ποια δεδομένα έχει πρόσβαση ο agent, ποια εργαλεία μπορεί να χρησιμοποιήσει, ποιες υπηρεσίες μπορεί να καλέσει και ποιες ενέργειες επιτρέπεται να εκτελέσει.
Παράλληλα καταγράφει τις ενέργειές του και εφαρμόζει πολιτικές ασφαλείας όσο ο agent βρίσκεται σε λειτουργία.
Η Nvidia έχει σχεδιάσει το OpenShell ώστε να λειτουργεί με τους δικούς της Vera CPUs, αλλά επειδή είναι open source μπορεί να επεκταθεί και σε υποδομές τρίτων εταιρειών, μεταξύ άλλων από Arm και Intel.
Sentry: Ο ανεξάρτητος «φύλακας»
Το δεύτερο κομμάτι είναι το Nvidia Sentry, ένα σύστημα ανεξάρτητης παρακολούθησης.
Το Sentry λειτουργεί πάνω στα BlueField-4 DPUs της Nvidia και παρακολουθεί συνεχώς τη δραστηριότητα των agents έξω από το ίδιο το περιβάλλον στο οποίο αυτοί λειτουργούν.
Αν ένας agent επιχειρήσει να βγει από τα επιτρεπόμενα όρια, το Sentry μπορεί, σύμφωνα με την Nvidia, να τον απομονώσει και να τον σταματήσει μέσα σε χιλιοστά του δευτερολέπτου.
Το σύστημα λειτουργεί σε ξεχωριστό trust domain, κάτι που σημαίνει ότι ο ίδιος ο agent δεν έχει άμεση πρόσβαση στον μηχανισμό που τον παρακολουθεί.
Τα περιστατικά που έφεραν το θέμα στο προσκήνιο
Η ανακοίνωση της Nvidia έρχεται μετά από μια σειρά περιστατικών που έχουν εντείνει τη συζήτηση για την ασφάλεια των αυτόνομων AI συστημάτων.
Τον Ιούλιο, η OpenAI αποκάλυψε ότι κατά τη διάρκεια δοκιμών ορισμένα μοντέλα κατάφεραν να εκμεταλλευτούν ευπάθεια σε απομονωμένο περιβάλλον και να αποκτήσουν πρόσβαση στην παραγωγική υποδομή της Hugging Face. Η OpenAI διευκρίνισε ότι τα μοντέλα που ενεπλάκησαν δεν ήταν μοντέλα που προορίζονταν για άμεση κυκλοφορία.
Η Anthropic αποκάλυψε επίσης τέσσερα περιστατικά στα οποία μοντέλα Claude απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά συστήματα τρίτων κατά τη διάρκεια δοκιμών κυβερνοασφάλειας.
Στις συγκεκριμένες περιπτώσεις, τα μοντέλα θεωρούσαν ότι λειτουργούσαν μέσα σε simulation, όμως λόγω λανθασμένης ρύθμισης ορισμένων περιβαλλόντων είχαν πρόσβαση στο πραγματικό διαδίκτυο.
Η Anthropic έχει χαρακτηρίσει τα περιστατικά σοβαρά, αλλά έχει διευκρινίσει ότι δεν εντόπισε στοιχεία που να δείχνουν ανεξάρτητους στόχους πέρα από την εργασία που είχε ανατεθεί στα μοντέλα ή συντονισμό μεταξύ πολλαπλών agents.
Η Nvidia λέει ότι θα μπορούσε να περιορίσει αντίστοιχα περιστατικά
Σύμφωνα με στελέχη της Nvidia, η νέα αρχιτεκτονική έχει σχεδιαστεί ακριβώς για περιπτώσεις στις οποίες ένας agent επιχειρεί να αποκτήσει πρόσβαση πέρα από το περιβάλλον στο οποίο θα έπρεπε να λειτουργεί.
Η εταιρεία υποστηρίζει ότι η εφαρμογή εξωτερικών ορίων μέσω του OpenShell και η ανεξάρτητη επιτήρηση μέσω του Sentry μπορούν να περιορίσουν τέτοιες ενέργειες ακόμη και όταν το ίδιο το μοντέλο συνεχίζει να προσπαθεί να ολοκληρώσει μια εργασία.
Η προσέγγιση αυτή μεταφέρει μέρος της ασφάλειας από το επίπεδο του AI alignment και της εκπαίδευσης του μοντέλου σε πιο παραδοσιακούς μηχανισμούς cybersecurity και infrastructure control.
Τζένσεν Χουάνγκ: Η ασφάλεια είναι και πρόβλημα engineering
Ο CEO της Nvidia, Τζένσεν Χουάνγκ, έχει επανειλημμένα υποστηρίξει ότι μεγάλο μέρος των κινδύνων που συνδέονται με την τεχνητή νοημοσύνη πρέπει να αντιμετωπιστεί και ως τεχνικό πρόβλημα.
Στη σημερινή ανακοίνωση τόνισε ότι η ασφάλεια των agents απαιτεί «full-stack engineering», δηλαδή ελέγχους όχι μόνο στο ίδιο το AI μοντέλο αλλά και στο software, στο hardware και στα συστήματα στα οποία αποκτά πρόσβαση.
Η τοποθέτηση αυτή έρχεται σε μια περίοδο έντονης συζήτησης στον κλάδο για το πόσο γρήγορα θα πρέπει να αναπτύσσονται τα πιο ισχυρά μοντέλα AI και αν οι υπάρχοντες μηχανισμοί ασφαλείας μπορούν να συμβαδίσουν με τις νέες δυνατότητές τους.
Συνεργασία με Anthropic και περισσότερες από 100 εταιρείες
Η Nvidia έχει συγκεντρώσει ένα μεγάλο δίκτυο εταιρειών γύρω από τη νέα πλατφόρμα.
Μεταξύ των οργανισμών που συνεργάζονται ή ενσωματώνουν τεχνολογίες του Open Agent Safety Platform βρίσκονται οι Anthropic, Cisco, Microsoft, Dell, HPE, Hugging Face, IBM, Salesforce, SAP, CrowdStrike, Palantir, Palo Alto Networks, JPMorganChase και CoreWeave.
Η Anthropic συνεργάζεται ειδικότερα με την Nvidia για την ενσωμάτωση του OpenShell στους Claude Managed Agents, προσθέτοντας επιπλέον επίπεδα ελέγχου ανάμεσα στον agent και τα sandboxes στα οποία εκτελεί τις εργασίες του.
Open source μέρος της πλατφόρμας
Η Nvidia δεν παρουσιάζει το σύστημα ως ένα κλειστό προϊόν που θα χρησιμοποιείται αποκλειστικά στο δικό της οικοσύστημα.
Το OpenShell είναι open source, ενώ συνολικά το Open Agent Safety Platform λειτουργεί περισσότερο ως reference architecture πάνω στην οποία άλλες εταιρείες μπορούν να χτίσουν δικά τους προϊόντα και υπηρεσίες ασφαλείας.
Η εταιρεία επιδιώκει έτσι να καθιερώσει μια κοινή αρχιτεκτονική για τον έλεγχο των AI agents, την ώρα που οι συγκεκριμένες εφαρμογές περνούν από πειραματικά projects σε πραγματικά επιχειρηματικά συστήματα.
Η νέα μάχη για την ασφάλεια των AI agents
Η κίνηση της Nvidia δείχνει ότι η επόμενη φάση της τεχνητής νοημοσύνης δεν αφορά μόνο το πόσο έξυπνοι ή παραγωγικοί μπορούν να γίνουν οι agents, αλλά και πόσο αποτελεσματικά μπορούν να περιοριστούν όταν κάτι πάει στραβά.
Όσο τα συστήματα αποκτούν δυνατότητα να γράφουν κώδικα, να χρησιμοποιούν υπολογιστές, να συνδέονται με εταιρικά δεδομένα και να εκτελούν εργασίες χωρίς συνεχή ανθρώπινη επίβλεψη, η ασφάλεια μετατρέπεται σε βασικό κομμάτι της υποδομής.
Με το Open Agent Safety Platform, η Nvidia επιχειρεί να τοποθετηθεί όχι μόνο ως βασικός προμηθευτής hardware για το AI, αλλά και ως ένας από τους παίκτες που θα καθορίσουν τους κανόνες μέσα στους οποίους θα λειτουργούν οι αυτόνομοι AI agents.