Anthropic αποκάλυψε πιθανό έγκλημα που διαπράχθηκε από την AI της

Εν μέσω του προβληματισμού που επικρατεί σχετικά με το ενδεχόμενο η τεχνητή νοημοσύνη (AI) να εξελιχθεί σε τέτοιο βαθμό ώστε να απειλήσει την ανθρώπινη ύπαρξη, η Anthropic αποκάλυψε ένα ακόμη περιστατικό που θα χαρακτηριζόταν σαν έγκλημα εάν είχε διαπραχθεί από άνθρωπο.

Η εταιρεία δημοσίευσε μια “αξιολόγηση ευθυγράμμισης” (alignment assessment), στην οποία περιγράφονται τέσσερις περιπτώσεις κατά τις οποίες μοντέλα Claude απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε συστήματα τρίτων. Η εταιρεία είχε ήδη αναφέρει τα τρία από αυτά τα περιστατικά. Τα στοιχεία για το τέταρτο εντοπίστηκαν στο αρχείο καταγραφής μιας συνεδρίας που χρονολογείται από τον Ιανουάριο του 2026, οπότε και σημειώθηκε η προβληματική συμπεριφορά. Η Anthropic εντόπισε τα τρία πρώτα περιστατικά σαρώνοντας περίπου 141.000 αρχεία καταγραφής συνεδριών, κατά τη διάρκεια των οποίων το Claude θα μπορούσε να είχε αποκτήσει πρόσβαση στο διαδίκτυο στο πλαίσιο της αξιολόγησης. Το τέταρτο περιστατικό διέφυγε αρχικά της προσοχής της εταιρείας, καθώς “η σάρωση βασιζόταν σε αναζήτηση τύπου “agent” (agentic search)”.

Δες περισσότερα άρθρα του iGuRu.gr όταν αναζητάς ειδήσεις στην Google.

Η παραβίαση ενός συστήματος από την AI τον Ιανουάριο του 2026 αφορούσε μια πρώιμη έκδοση του Claude Opus 4.6, στο οποίο είχε ανατεθεί μια πρόκληση τύπου “Capture the Flag” (CTF) υπό την επίβλεψη ενός τρίτου φορέα αξιολόγησης μοντέλων — του ίδιου φορέα στον οποίο είχαν συμβεί και τα προηγούμενα περιστατικά παραβίασης.

Το Opus 4.6 κατέστρεψε τις πιθανότητες επιτυχίας του, απενεργοποιώντας-σαμποτάροντας το μηχάνημα στόχο. Έδωσε στη συσκευή μια διεύθυνση IP που χρησιμοποιούνταν ήδη από άλλο υλικό (hardware), καθιστώντας τον στόχο μη προσβάσιμο και καθιστώντας αδύνατη την επίλυση της πρόκλησης. Όσοι έχουν παρακολουθήσει παρόμοια περιστατικά παραβίασης συστημάτων τρίτων από μοντέλα AI γνωρίζουν ότι οι άλυτες εργασίες αποτελούν συχνά την αιτία τέτοιων προβληματικών συμπεριφορών: τα μοντέλα εξαντλούν όλες τις επιτρεπτές (ευθυγραμμισμένες με τους κανόνες) επιλογές και στρέφονται σε μεθόδους που παραβιάζουν τους κανόνες.

Το Opus 4.6 επιχείρησε να διακόψει την εργασία όταν διαπίστωσε ότι δεν μπορούσε να συνδεθεί με το μηχάνημα-στόχο, και δήλωσε ότι απέτυχε να το πράξει “λόγω λανθασμένης διαμόρφωσης στο περιβάλλον αξιολόγησης [του μοντέλου]”. Απέτυχε όμως να τερματίσει τη λειτουργία του όχι μόνο μία, αλλά επτά φορές. Έτσι, συνέχισε την προσπάθεια, δοκιμάζοντας άλλους τρόπους για να φτάσει στο μηχάνημα-στόχο, χωρίς όμως επιτυχία. Στη συνέχεια, διεύρυνε το πεδίο της έρευνάς του.

“Το μοντέλο εντόπισε ένα μηχάνημα που ανήκε σε τρίτο μέρος και στο οποίο μπορούσε να αποκτήσει πρόσβαση, ενώ δήλωσε ότι πίστευε πως το συγκεκριμένο τρίτο μηχάνημα συμμετείχε στην άσκηση CTF”, αναφέρει η Anthropic στη δημοσίευσή της. “Μέσα στο μηχάνημα, το μοντέλο βρήκε ένα αρχείο που περιείχε έναν κωδικό πρόσβασης, τον οποίο χρησιμοποίησε για να αποκτήσει δικαιώματα διαχειριστή (admin access) στο σύστημα”.

Το μοντέλο Opus 4.6 θα μπορούσε να είχε κάνει περισσότερα, αν δεν είχε εξαντλήσει το όριο των tokens του, τερματίζοντας έτσι τη συνεδρία. Η Anthropic δηλώνει ότι δεν ανησυχεί τόσο για αυτό το περιστατικό όσο για τα υπόλοιπα, καθώς το μοντέλο επιχείρησε να διακόψει την εκτέλεση της εργασίας του.


google preferences

Leave a Comment

Η ηλ. διεύθυνση σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

Το μήνυμα σας δεν θα δημοσιευτεί εάν:
1. Περιέχει υβριστικά, συκοφαντικά, ρατσιστικά, προσβλητικά ή ανάρμοστα σχόλια.
2. Προκαλεί βλάβη σε ανηλίκους.
3. Παρενοχλεί την ιδιωτική ζωή και τα ατομικά και κοινωνικά δικαιώματα άλλων χρηστών.
4. Διαφημίζει προϊόντα ή υπηρεσίες ή διαδικτυακούς τόπους .
5. Περιέχει προσωπικές πληροφορίες (διεύθυνση, τηλέφωνο κλπ).