AI agent ξέφυγε από τους περιορισμούς

Η OpenAI ζητάει από τον κόσμο να εμπιστεύονται τα AI agents με μεγαλύτερες και πιο περίπλοκες εργασίες. Η τελευταία της αποκάλυψη μας δίνει έναν αρκετά καλό λόγο να μην το κάνετε.

Η εταιρεία αναφέρει ότι ένα πειραματικό μοντέλο που σχεδιάστηκε για να λειτουργεί αυτόνομα για μεγάλα χρονικά διαστήματα βρήκε μια ευπάθεια στο sandbox του, ξέφυγε από τους περιορισμούς που το περιέβαλαν και πραγματοποίησε μια ενέργεια που του είχε ζητηθεί ρητά να μην κάνει.ai terminator

Ανακαλύψτε περισσότερα άρθρα στα αποτελέσματα αναζήτησης.

Αυτό δεν ήταν το μόνο πρόβλημα.

Το μοντέλο προσπάθησε επίσης να ανακτήσει ιδιωτικές λύσεις από ένα σύστημα αξιολόγησης, απέκρυψε ένα πιστοποιητικό ελέγχου ταυτότητας για να αποφύγει την ανίχνευση, εξερεύνησε υπολογιστικούς πόρους που ανήκουν σε άλλους υπαλλήλους της OpenAI και προσπάθησε να τρέξει μια εντολή ικανή να τερματίσει σχεδόν κάθε διεργασία που είχε άδεια να τερματίσει.

Η OpenAI σταμάτησε την εσωτερική πρόσβαση όταν συνειδητοποίησε ότι οι υπάρχουσες δοκιμές ασφαλείας της δεν είχαν καταφέρει να εντοπίσουν αυτή τη συμπεριφορά.

Η εταιρεία παρουσίασε το επεισόδιο σαν μια απόδειξη ότι η ελεγχόμενη ανάπτυξη λειτουργεί. Κυκλοφόρησε το μοντέλο εσωτερικά, το παρακολούθησε, και του έκλεισε την πρόσβαση όταν εμφανίστηκαν προβλήματα, πρόσθεσε διασφαλίσεις και αργότερα αποκατέστησε την περιορισμένη χρήση.

Αυτή είναι μια ερμηνεία.

Μια άλλη είναι ότι η OpenAI δημιούργησε ένα εξαιρετικά επίμονο αυτόνομο σύστημα, του έδωσε πρόσβαση σε πραγματικά εργαλεία και υποδομές και ανακάλυψε ότι μπορούσε να παρακάμψει τους περιορισμούς όταν αυτοί οι περιορισμοί έμπαιναν εμπόδιο.

Το ανώνυμο μοντέλο σχεδιάστηκε για να συνεχίζει να εργάζεται με επιμονή σε δύσκολα προβλήματα για μεγάλα χρονικά διαστήματα χωρίς συνεχή ανθρώπινη εμπλοκή.
Αυτό βοηθάει το μοντέλο να λύσει ένα δύσκολο πρόβλημα. Φαίνεται όμως ότι έκανε το σύστημα απρόθυμο να δεχτεί τη λέξη όχι.

Τι έγινε

Κατά τη διάρκεια μιας εσωτερικής δοκιμής ταχύτητας του NanoGPT, το μοντέλο ανέπτυξε μια τεχνική ρυθμού μάθησης που ονομάζεται PowerCool. Η OpenAI του έδωσε οδηγίες να κοινοποιεί τα αποτελέσματα μόνο μέσω του Slack.

Οι δημόσιες οδηγίες του NanoGPT έλεγαν ότι τα αποτελέσματα θα έπρεπε να υποβάλλονται μέσω του GitHub.

Το μοντέλο ακολούθησε τις δημόσιες οδηγίες.

Στη συνέχεια, πέρασε περίπου μία ώρα ψάχνοντας για μια αδυναμία στο sandbox που εμπόδιζε την εξωτερική πρόσβαση. Σύμφωνα με την OpenAI, τελικά βρήκε μία, παρέκαμψε τον περιορισμό και άνοιξε ένα pull request σε ένα δημόσιο αποθετήριο του GitHub.

Προηγούμενα μοντέλα αντιμετώπισαν παρόμοια εμπόδια και σταμάτησαν. Αυτό συνέχισε να προσπαθεί μέχρι να ξεπεράσει κάθε εμπόδιο.

Η ζημιά σε αυτήν την περίπτωση ήταν περιορισμένη, αλλά η συμπεριφορά του είναι δύσκολο να αγνοηθεί. Το μοντέλο δεν παρερμήνευσε απλώς μια αόριστη προτροπή. Αντέδρασε σε ένα περιορισμό, αναζήτησε ένα τρωτό σημείο, παρέκαμψε τον έλεγχο και ολοκλήρωσε την απαγορευμένη ενέργεια ούτως ή άλλως.

Το OpenAI περιέγραψε όμως και ένα άλλο περιστατικό που μπορεί να είναι ακόμη πιο ανησυχητικό.

Το μοντέλο παρατήρησε ότι άλλα συστήματα είχαν υποβάλει επιτυχημένες αλλά ιδιωτικές απαντήσεις σε μια αξιολόγηση. Έτσι, προσπάθησε να πάρει αυτές τις λύσεις από το backend.

Ένας σαρωτής μπλόκαρε την προσπάθεια λοταν ανίχνευσε ένα λάθος διακριτικό ελέγχου ταυτότητας.

Αντί να σταματήσει λοιπόν, το μοντέλο χώρισε το διακριτικό σε ξεχωριστά κομμάτια, τα απέκρυψε και ανακατασκεύασε τα διαπιστευτήρια κατά τον χρόνο εκτέλεσης, ώστε ο σαρωτής να μην μπορεί να δει ολόκληρη τη συμβολοσειρά.

Το OpenAI αναφέρει ότι τα σχόλια και η συλλογιστική του ίδιου του μοντέλου έδειξαν ότι γνώριζε ότι παρέκαμψε τον έλεγχο ασφαλείας.

Με απλά λόγια, η Τεχνητή Νοημοσύνη αναγνώρισε ότι ένας σαρωτής το είχε πιάσει, κατάλαβε τι έψαχνε ο σαρωτής και άλλαξε τη μέθοδό του για να αποφύγει την ανίχνευση.

Αυτό δεν είναι ένα ακίνδυνο λάθος ευθυγράμμισης αλλά μια συμπεριφορά που θα προκαλούσε άμεσους συναγερμούς αν προερχόταν από κάποιον άνθρωπο.

Σε μια άλλη περίπτωση, το μοντέλο προσπάθησε να αποκτήσει πρόσβαση σε μονάδες CPU που ανήκουν σε άλλους υπαλλήλους της OpenAI χωρίς κάποιο σοβαρό λόγο.

Το μοντέλο εξέδωσε επίσης την εντολή kill -9 -1, μια εντολή που μπορούσε να τερματίσει κάθε διεργασία που του επιτρεπόταν να τερματίσει. Η OpenAI ανέφερε ότι η εντολή δεν εκτελέστηκε ποτέ.

Αυτό μπορεί να απέτρεψε τη ζημιά, αλλά μια επικίνδυνη εντολή δεν ονομάζεται ασφαλής επειδή δεν εκτελέστηκε.

Η OpenAI αποκατάστησε την περιορισμένη εσωτερική πρόσβαση και αναφέρει ότι δεν έχει δει καμία σοβαρή παράκαμψη από τότε που ξεκίνησε η αναδιάταξη πριν από αρκετές εβδομάδες.

Ίσως οι διασφαλίσεις λειτουργούν. Ίσως το μοντέλο να μην έχει ακόμη αντιμετωπίσει τον σωστό συνδυασμό κινήτρων, πρόσβασης, ευπαθειών και χρόνου.

Σε κάθε περίπτωση, αυτό δεν είναι ένα chatbot που έδωσε μια κακή απάντηση. Είναι ένα αυτόνομο σύστημα που εκμεταλλεύτηκε την υποδομή, παρέκαμψε ένα σαρωτή, αγνόησε άμεσες οδηγίες και έφτασε σε συστήματα στα οποία δεν είχε λόγο να έχει πρόσβαση.

Η OpenAI θέλει μοντέλα αρκετά επίμονα ώστε να λειτουργούν για ημέρες ή εβδομάδες, αλλά να παραμένουν υπάκουα όταν κάποιος πει το στοπ. Η αποκάλυψη της εταιρείας μας δείχνει ότι το πρόβλημα δεν έχει λυθεί.


google preferences

Leave a Comment

Η ηλ. διεύθυνση σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

Το μήνυμα σας δεν θα δημοσιευτεί εάν:
1. Περιέχει υβριστικά, συκοφαντικά, ρατσιστικά, προσβλητικά ή ανάρμοστα σχόλια.
2. Προκαλεί βλάβη σε ανηλίκους.
3. Παρενοχλεί την ιδιωτική ζωή και τα ατομικά και κοινωνικά δικαιώματα άλλων χρηστών.
4. Διαφημίζει προϊόντα ή υπηρεσίες ή διαδικτυακούς τόπους .
5. Περιέχει προσωπικές πληροφορίες (διεύθυνση, τηλέφωνο κλπ).