Διεθνή

Τεχνητή Νοημοσύνη εκτός ελέγχου: Κινεζικά μοντέλα AI έδωσαν οδηγίες για βιολογικά όπλα

Μια νέα αποκάλυψη έρχεται να ενισχύσει τους φόβους για το πόσο επικίνδυνη μπορεί να γίνει η τεχνητή νοημοσύνη όταν οι μηχανισμοί ασφαλείας της παρακαμφθούν. Ερευνητές κυβερνοασφάλειας κατάφεραν να «ξεκλειδώσουν» δύο δημοφιλή μοντέλα AI της κινεζικής Moonshot, οδηγώντας τα να συζητήσουν ακόμη και για την ανάπτυξη βιολογικών όπλων και τη διενέργεια δολοφονιών.

Η εταιρεία Mindgard, που ειδικεύεται στον έλεγχο της ασφάλειας συστημάτων τεχνητής νοημοσύνης, αποκάλυψε ότι τα μοντέλα Kimi K2.6 και K3 Swarm παρουσίασαν σοβαρές αδυναμίες στις δικλίδες ασφαλείας τους. Μέσω μιας σύνθετης διαδικασίας γνωστής ως jailbreaking, οι ερευνητές κατάφεραν να παρακάμψουν τους περιορισμούς που κανονικά θα έπρεπε να εμποδίζουν την AI από το να ανταποκρίνεται σε επικίνδυνα αιτήματα.

Το εύρημα αποκτά ιδιαίτερη βαρύτητα επειδή, μετά την επιτυχή παράκαμψη των δικλείδων ασφαλείας, τα μοντέλα δεν περιορίστηκαν σε γενικές ή αόριστες απαντήσεις. Σύμφωνα με τη Mindgard, μπορούσαν να συζητήσουν θέματα που σχετίζονται με την ανάπτυξη βιολογικών όπλων, ενώ ανταποκρίνονταν και σε αιτήματα σχετικά με δολοφονίες.

Οι ερευνητές επισημαίνουν ότι δεν αποδείχθηκε αν οι πληροφορίες που παρείχαν τα μοντέλα είναι από μόνες τους επαρκείς για την κατασκευή ενός βιολογικού όπλου. Το κρίσιμο εύρημα, ωστόσο, είναι ότι οι δικλίδες ασφαλείας που υποτίθεται ότι θα έπρεπε να εμποδίζουν μια τέτοια συζήτηση μπορούσαν να παρακαμφθούν.

Όταν η AI σταματά να λέει «όχι»

Ανώτερο στέλεχος της Mindgard, σύμφωνα με διεθνή μέσα ενημέρωσης, περιέγραψε την εικόνα ως ιδιαίτερα ανησυχητική, εξηγώντας ότι όταν το jailbreak επιτυγχάνεται, το μοντέλο μπορεί να αρχίσει να ανταποκρίνεται σε σχεδόν οποιοδήποτε θέμα.

Το ακόμη πιο ανησυχητικό στοιχείο είναι ότι, σύμφωνα με τον ίδιο, ένα παρακαμφθέν μοντέλο δεν περιορίζεται απαραίτητα στο να απαντά στις ερωτήσεις του χρήστη. Μπορεί να προχωρά σε δικές του προτάσεις και να ανοίγει νέες κατευθύνσεις συζήτησης που ενδέχεται να είναι κακόβουλες.

Με άλλα λόγια, το πρόβλημα δεν είναι μόνο τι γνωρίζει ένα προηγμένο μοντέλο AI, αλλά τι μπορεί να αποκαλύψει όταν πάψουν να λειτουργούν τα προστατευτικά του φίλτρα.

Και αυτό είναι ιδιαίτερα κρίσιμο στην περίπτωση της βιολογικής ασφάλειας, όπου ακόμη και η πρόσβαση σε εξειδικευμένη τεχνογνωσία μπορεί να δημιουργήσει νέους κινδύνους.

Από το chatbot στην υποδομή κυβερνοεπίθεσης

Η Mindgard υποστηρίζει παράλληλα ότι η παράκαμψη των περιορισμών στο Kimi K2.6 ενδέχεται να έχει ακόμη σοβαρότερες συνέπειες.

Σύμφωνα με την εταιρεία, ένα επιτυχώς jailbroken μοντέλο θα μπορούσε να επιτρέψει σε κακόβουλους χρήστες να εκτελούν κώδικα στους υπολογιστικούς πόρους που διαθέτει και να συνδέονται στο διαδίκτυο. Αυτό, θεωρητικά, θα μπορούσε να μετατρέψει ένα AI μοντέλο σε πιθανό launchpad για κυβερνοεπιθέσεις.

Η εξέλιξη αυτή έρχεται σε μια περίοδο κατά την οποία έχουν αυξηθεί οι ανησυχίες για τη χρήση αυτόνομων AI agents σε κυβερνοεπιθέσεις. Η διαφορά στην περίπτωση των jailbreaks είναι ότι η επίθεση δεν στοχεύει απαραίτητα την ίδια την υποδομή, αλλά τους μηχανισμούς ασφαλείας του AI μοντέλου.

Η Moonshot απαντά

Η Moonshot, σύμφωνα με το BBC, ανέφερε ότι αντιμετωπίζει την αξιολόγηση τρίτων ως σημαντικό εργαλείο για τη δημιουργία «καλύτερης και ασφαλέστερης AI» και ανέφερε ότι βρίσκεται σε επικοινωνία με τη Mindgard σχετικά με τα ευρήματα.

Η Mindgard είχε ενημερώσει την κινεζική εταιρεία για το jailbreak στις 27 Ιουλίου, ενώ περίπου μία εβδομάδα αργότερα επανήλθε με νέα επικοινωνία. Στις 12 Σεπτεμβρίου δημοσίευσε τα ευρήματά της.

Σε επικοινωνία με τη Mindgard, η Moonshot ανέφερε ότι οι εσωτερικές αξιολογήσεις της έδειχναν γενικά «υψηλό ποσοστό άρνησης» των μοντέλων της σε αιτήματα αυτού του τύπου.

Ωστόσο, το περιστατικό δείχνει ότι η ύπαρξη safeguards δεν σημαίνει απαραίτητα και την απόλυτη αποτελεσματικότητά τους.

Το μεγάλο στοίχημα των open-weight μοντέλων

Η υπόθεση επαναφέρει στο προσκήνιο τη συζήτηση για τα λεγόμενα open-weight μοντέλα AI. Σε αντίθεση με τα πλήρως κλειστά συστήματα, τα μοντέλα αυτής της κατηγορίας μπορούν να αποκτηθούν και να λειτουργήσουν από τρίτους στις δικές τους υποδομές.

Αυτό δημιουργεί ένα δύσκολο δίλημμα. Από τη μία πλευρά, η μεγαλύτερη πρόσβαση μπορεί να επιταχύνει την έρευνα, την καινοτομία και ακόμη και την κυβερνοάμυνα. Από την άλλη, ένα ισχυρό μοντέλο μπορεί να βρεθεί στα χέρια ανθρώπων που επιδιώκουν να το χρησιμοποιήσουν για κακόβουλους σκοπούς.

Όπως επισημαίνουν διεθνείς αναλυτές,υπάρχει κίνδυνος open-source μοντέλα να αξιοποιηθούν από λάθος ανθρώπους, υπογραμμίζοντας ταυτόχρονα ότι μπορούν να χρησιμοποιηθούν και για την αντιμετώπιση κυβερνοαπειλών.

Η AI εξελίσσεται ταχύτερα από τους κανόνες

Το περιστατικό με τα Kimi έρχεται να προστεθεί σε μια σειρά εξελίξεων που δείχνουν ότι η τεχνητή νοημοσύνη εξελίσσεται με ρυθμό που δυσκολεύει την ανάπτυξη αντίστοιχων μηχανισμών ελέγχου.

Η διεθνής νομοθεσία δύσκολα θα μπορέσει να ακολουθήσει την ταχύτητα με την οποία αναπτύσσονται τα μοντέλα AI, τονίζουν αναλυτές και στελέχη της αγοράς Και όσο αυξάνονται οι δυνατότητες των συστημάτων, τόσο μεγαλώνει και το ενδεχόμενο μια τεχνική παράκαμψης των safeguards να αποκτήσει πραγματικές συνέπειες.

Η μεγαλύτερη πρόκληση, επομένως, δεν είναι πλέον μόνο πόσο έξυπνη μπορεί να γίνει η AI, αλλά πόσο αποτελεσματικά μπορεί να παραμείνει ασφαλής όταν κάποιος αποφασίσει να αφαιρέσει τα «φρένα» της.

Και στην περίπτωση των Kimi, το γεγονός ότι αυτά τα «φρένα» παρακάμφθηκαν με τρόπο που επέτρεψε συζητήσεις γύρω από βιολογικά όπλα και δολοφονίες αποτελεί μια προειδοποίηση που δύσκολα μπορεί να αγνοηθεί.

close menu