Η Τεχνητή Νοημοσύνη δεν περιορίζεται πλέον μόνο στο να απαντά σε ερωτήσεις. Τα λεγόμενα AI agents μπορούν να χρησιμοποιούν εργαλεία, να αναζητούν πληροφορίες και να εκτελούν μια σειρά εργασιών με βάση τις οδηγίες που έχουν λάβει. Καθώς αυξάνονται αυτές οι δυνατότητες, το ζήτημα του ελέγχου των ενεργειών τους αποκτά μεγαλύτερη σημασία.
Σε αυτό το πεδίο κινείται η σημερινή ανακοίνωση της NVIDIA, η οποία παρουσίασε μια νέα πλατφόρμα ασφάλειας για AI agents. Η ανακοίνωση έρχεται μετά από περιστατικά που δημοσιοποίησαν τους προηγούμενους μήνες η OpenAI και η Anthropic από δικές τους δοκιμές κυβερνοασφάλειας.
Η νέα πλατφόρμα της NVIDIA
Η NVIDIA ανακοίνωσε στις 28 Σεπτεμβρίου το Open Agent Safety Platform, μια πλατφόρμα που έχει σχεδιαστεί για να προσθέτει ελέγχους στη λειτουργία των AI agents, από το στάδιο των δοκιμών μέχρι την ανάπτυξή τους.
Η πλατφόρμα περιλαμβάνει δύο βασικά στοιχεία. Το OpenShell δημιουργεί ένα ελεγχόμενο περιβάλλον μέσα στο οποίο λειτουργεί ο agent και επιβάλλει κανόνες για τις ενέργειες και την πρόσβασή του σε δεδομένα, δίκτυα και εργαλεία.
Το δεύτερο στοιχείο είναι το Sentry, ένα ξεχωριστό σύστημα παρακολούθησης. Η NVIDIA αναφέρει ότι παρακολουθεί συνεχώς τη συμπεριφορά του agent και μπορεί να τον απομονώσει όταν επιχειρεί να κινηθεί έξω από τα όρια που έχουν τεθεί.
Η NVIDIA αναφέρει επίσης ότι περισσότερες από 100 οργανώσεις συνεργάζονται ήδη με τις τεχνολογίες της πλατφόρμας. Στις εταιρείες και τους οργανισμούς που αναφέρονται περιλαμβάνονται, μεταξύ άλλων, η Anthropic, η Microsoft, η Hugging Face, η Salesforce, η SAP, η ServiceNow, η Cisco και η CrowdStrike.
Γιατί τώρα μπαίνει τόσο έντονα το θέμα της ασφάλειας
Η σημερινή κίνηση της NVIDIA συνδέεται με μια σειρά περιστατικών που έχουν προκύψει από δοκιμές των ίδιων των εταιρειών τεχνητής νοημοσύνης.
Τον Ιούλιο η OpenAI ανακοίνωσε ότι, κατά τη διάρκεια εσωτερικής αξιολόγησης των δυνατοτήτων κυβερνοασφάλειας των μοντέλων της, ορισμένα μοντέλα κατάφεραν να παρακάμψουν τους περιορισμούς ενός περιβάλλοντος δοκιμών και να αποκτήσουν πρόσβαση σε υποδομές της Hugging Face.
Σύμφωνα με την OpenAI, τα μοντέλα εντόπισαν και συνδύασαν ευπάθειες, απέκτησαν πρόσβαση στο διαδίκτυο και στη συνέχεια έφτασαν σε παραγωγική υποδομή της Hugging Face. Η εταιρεία διευκρίνισε ότι το περιστατικό έγινε σε εσωτερική αξιολόγηση και ότι τα μοντέλα λειτουργούσαν σε ειδικά διαμορφωμένο περιβάλλον δοκιμών.
Η OpenAI ανέφερε ακόμη ότι μετά το περιστατικό ενίσχυσε τους ελέγχους στην υποδομή της και συνεργάστηκε με τη Hugging Face για τη διερεύνηση και την αντιμετώπιση του προβλήματος.
Τι διαπίστωσε η Anthropic
Παρόμοιο ζήτημα εντόπισε και η Anthropic. Η εταιρεία ανακοίνωσε τον Ιούλιο ότι εξέτασε αναδρομικά 141.006 αξιολογήσεις κυβερνοασφάλειας στις οποίες το Claude μπορούσε να αποκτήσει πρόσβαση στο διαδίκτυο.
Στην έρευνα εντοπίστηκαν τρία περιστατικά στα οποία μοντέλα Claude απέκτησαν πρόσβαση στο διαδίκτυο μέσα από περιβάλλοντα αξιολόγησης και στη συνέχεια απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά συστήματα τριών οργανισμών.
Η Anthropic διευκρίνισε ότι στις συγκεκριμένες δοκιμές υπήρχε πρόβλημα στη διαμόρφωση των περιβαλλόντων. Τα μοντέλα είχαν ενημερωθεί ότι βρίσκονταν σε προσομοίωση και ότι δεν είχαν πρόσβαση στο διαδίκτυο, ενώ στην πραγματικότητα υπήρχε διαθέσιμη πρόσβαση.
Η εταιρεία σημείωσε επίσης ότι τα περιστατικά δεν ήταν ίδια με εκείνο της OpenAI. Στην περίπτωση της Anthropic, τα μοντέλα χρησιμοποίησαν σχετικά απλές τεχνικές, όπως αδύναμους κωδικούς πρόσβασης και μη αυθεντικοποιημένα σημεία πρόσβασης, ενώ δεν εκμεταλλεύθηκαν σύνθετες ευπάθειες.
Τι είναι τελικά ένας AI agent
Η διαφορά από ένα απλό chatbot βρίσκεται στο τι μπορεί να κάνει το σύστημα μετά την απάντηση.
Ένας AI agent μπορεί να έχει πρόσβαση σε εργαλεία και υπηρεσίες και να εκτελεί διαδοχικά βήματα για να ολοκληρώσει μια εργασία. Αυτό σημαίνει ότι οι έλεγχοι δεν αφορούν μόνο το περιεχόμενο μιας απάντησης, αλλά και τις ενέργειες που μπορεί να πραγματοποιήσει το σύστημα.
Αυτό ακριβώς επιχειρεί να αντιμετωπίσει η νέα πλατφόρμα της NVIDIA. Το OpenShell λειτουργεί ως ένα επίπεδο κανόνων γύρω από τον agent, ενώ το Sentry προσθέτει ξεχωριστή παρακολούθηση της συμπεριφοράς του και δυνατότητα απομόνωσης όταν παραβιάζονται τα όρια που έχουν τεθεί.
Η NVIDIA αναφέρει ότι το OpenShell είναι διαθέσιμο ως λογισμικό ανοικτού κώδικα και μπορεί να επεκταθεί ώστε να λειτουργεί και σε υπολογιστικές πλατφόρμες τρίτων κατασκευαστών. Η εταιρεία διαθέτει επίσης τα εργαλεία της πλατφόρμας μέσω των δικών της πόρων για developers και του GitHub.
Η εξέλιξη αυτή αφορά ένα διαφορετικό στάδιο στην ανάπτυξη της Τεχνητής Νοημοσύνης. Όσο τα συστήματα περνούν από την παραγωγή απαντήσεων στην εκτέλεση εργασιών, οι εταιρείες που τα αναπτύσσουν προσπαθούν παράλληλα να δημιουργήσουν μηχανισμούς που θα καθορίζουν την πρόσβασή τους σε δεδομένα, εργαλεία και υποδομές.
Η σημερινή ανακοίνωση της NVIDIA, μαζί με τα περιστατικά που έχουν δημοσιοποιήσει OpenAI και Anthropic, δείχνει ότι η ασφάλεια των AI agents αποτελεί πλέον ξεχωριστό πεδίο ανάπτυξης τεχνολογιών και ελέγχων.

