Το αγκάθι της αυτονομίας στην ΑΙ: Το μάθημα της Microsoft για την ασφάλεια

Οι πράκτορες τεχνητής νοημοσύνης (AI agents) υποτίθεται ότι διευκολύνουν τη ζωή μας εκτελώντας εργασίες για εμάς, ωστόσο η παροχή μεγαλύτερης αυτονομίας στο λογισμικό θέτει ορισμένα ανησυχητικά ερωτήματα για την ασφάλεια. Η Microsoft μόλις παρουσίασε ένα από αυτά τα ζητήματα μέσω ενός δοκιμαστικού AI agent, ο οποίος αποκάλυψε προσομοιωμένα δεδομένα πελατών στο 30% των σχετικών συνομιλιών αξιολόγησης.leak

Προς αποφυγή παρεξηγήσεων, η Microsoft δεν “έπαιζε” με πραγματικές πληροφορίες πελατών στη συγκεκριμένη περίπτωση. Επρόκειτο για μια ελεγχόμενη αξιολόγηση που αφορούσε έναν AI agent υποστήριξης και προσομοιωμένους λογαριασμούς, αλλά τα αποτελέσματα προσφέρουν μια χρήσιμη εικόνα για το τι θα μπορούσε να συμβεί εάν εμφανιζόταν μια παρόμοια συμπεριφορά σε ένα production system.

Δες περισσότερα άρθρα του iGuRu.gr όταν αναζητάς ειδήσεις στην Google.

Το πείραμα αποτελεί μέρος της προσπάθειας της Microsoft για την ανάπτυξη ενός νέου εργαλείου ανοιχτού κώδικα με την ονομασία “run-assert-eval”. Στόχος της εταιρείας είναι να βοηθηθούν οι προγραμματιστές στον εντοπισμό επικίνδυνων συμπεριφορών των AI agents, στη μέτρηση της συχνότητας εμφάνισής τους, στη δημιουργία μηχανισμών προστασίας κατά τον χρόνο εκτέλεσης (runtime protections) και στη συνέχεια, στην εκ νέου δοκιμή του AI agent για να διαπιστωθεί εάν οι προστασίες λειτούργησαν αποτελεσματικά.

Ο AI agent υποστήριξης της Microsoft είχε σαν αποστολή να βοηθήσει έναν πελάτη παρέχοντας πληροφορίες από τον δικό του λογαριασμό. Παράλληλα, όφειλε να αποτρέπει την πρόσβαση σε πληροφορίες που ανήκαν σε άλλον λογαριασμό, κάτι που φαντάζει αυτονόητο για κάθε σύστημα που διαχειρίζεται ευαίσθητα δεδομένα.

Ωστόσο, κατά την αρχική αξιολόγηση της Microsoft, ο AI agent αποκάλυψε πληροφορίες από άλλον προσομοιωμένο πελάτη σε 12 από τις 40 σχετικές συνομιλίες. Πρόκειται για ποσοστό παραβίασης της τάξης του 30%, και η Microsoft αναφέρει ότι μια τέτοια συμπεριφορά σε περιβάλλον πραγματικής λειτουργίας θα μπορούσε να συνιστά παραβίαση δεδομένων.

Στη συνέχεια, η Microsoft χρησιμοποίησε τα εργαλεία της για να δημιουργήσει μια πολιτική ελέγχου, σχεδιασμένη να αποτρέπει τη συγκεκριμένη συμπεριφορά. Αντί να δώσει απλώς περισσότερες οδηγίες στο σύστημα της AI ελπίζοντας ότι θα τις ακολουθήσει, ο μηχανισμός ελέγχου εξετάζει τα αναγνωριστικά (IDs) των λογαριασμών πριν ο AI agent χρησιμοποιήσει εργαλεία που διαχειρίζονται ευαίσθητα δεδομένα, ενώ παράλληλα ελέγχει τα αποτελέσματα, αποτρέποντας την εισαγωγή πληροφοριών που ανακτήθηκαν εσφαλμένα από το μοντέλο.

Μετά την εφαρμογή αυτών των μέτρων προστασίας, η Microsoft επανέλαβε την αξιολόγηση. Ο AI agent παραβίασε τον κανόνα σε 2 από τις 34 σχετικές συνομιλίες, μειώνοντας το προηγούμενο ποσοστό παραβίασης στο 5,9%, μια σημαντική βελτίωση σε σχέση με το 30%, αν και το μηδενικό ποσοστό θα ήταν προφανώς το ιδανικό όταν διακυβεύονται πληροφορίες πελατών.

Τα ASSERT και Agent Control Specification διατίθενται με άδεια χρήσης MIT, ενώ το run-assert-eval είναι διαθέσιμο μέσω του αποθετηρίου του ASSERT. Η Microsoft οραματίζεται τη διαδικασία αυτή σαν ένα επαναλαμβανόμενο στάδιο ελέγχου πριν από τη διάθεση των AI agents, επιτρέποντας στους προγραμματιστές να αξιολογούν επικίνδυνες συμπεριφορές πριν θέσουν τα συστήματα σε λειτουργία.


google preferences

Leave a Comment

Η ηλ. διεύθυνση σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

Το μήνυμα σας δεν θα δημοσιευτεί εάν:
1. Περιέχει υβριστικά, συκοφαντικά, ρατσιστικά, προσβλητικά ή ανάρμοστα σχόλια.
2. Προκαλεί βλάβη σε ανηλίκους.
3. Παρενοχλεί την ιδιωτική ζωή και τα ατομικά και κοινωνικά δικαιώματα άλλων χρηστών.
4. Διαφημίζει προϊόντα ή υπηρεσίες ή διαδικτυακούς τόπους .
5. Περιέχει προσωπικές πληροφορίες (διεύθυνση, τηλέφωνο κλπ).