Η Anthropic ανακαλύπτει κρυφό «χώρο εργασίας» μέσα στο Claude AI

Η Anthropic δημοσίευσε τη Δευτέρα έρευνα που εντοπίζει έναν μικρό εσωτερικό «χώρο εργασίας» μέσα στο μοντέλο τεχνητής νοημοσύνης Claude — μια δομή που, σύμφωνα με την εταιρεία, χρησιμοποιεί το μοντέλο για να αποθηκεύει και να επεξεργάζεται ιδέες πριν τις εκφράσει, αντικατοπτρίζοντας μια κορυφαία νευροεπιστημονική θεωρία για την ανθρώπινη συνείδηση.

anthropic-claude

Η εργασία, με τίτλο «Verbalizable Representations Form a Global Workspace in Language Models», περιγράφει ένα υποσύνολο εσωτερικών ενεργοποιήσεων του Claude που η Anthropic ονόμασε «J-space», από τη μαθηματική τεχνική Jacobian που χρησιμοποιήθηκε για την ανακάλυψή του. Η εύρεση έγινε με ένα νέο εργαλείο ερμηνευσιμότητας που ονομάζεται «Jacobian lens» ή J-lens, το οποίο αντιστοιχίζει εσωτερικές ενεργοποιήσεις του μοντέλου σε αναγνώσιμες λέξεις, εκτιμώντας πώς αυτές οι ενεργοποιήσεις θα επηρέαζαν την μετέπειτα έξοδο.

Ένας Χώρος Εργασίας για Αδιατύπωτες Σκέψεις

Σύμφωνα με τη σελίδα έρευνας της Anthropic, ο J-space περιέχει μόνο μερικές δεκάδες έννοιες κάθε φορά και αντιπροσωπεύει λιγότερο από το ένα δέκατο της συνολικής δραστηριότητας του Claude, ωστόσο επωμίζεται μεγάλο μέρος του έργου που έχει σημασία για την ανώτερη συλλογιστική. Όταν ο Claude διαβάζει κώδικα με σφάλματα, ένα μοτίβο «ERROR» εμφανίζεται στον J-space. Όταν επεξεργάζεται μια επίθεση prompt injection, έννοιες όπως «injection» και «fake» αναδύονται — και όλα αυτά πριν το μοντέλο παράγει οποιοδήποτε κείμενο.

Η έρευνα δανείζεται το πλαίσιό της από τη θεωρία του παγκόσμιου χώρου εργασίας (global workspace theory), ένα σημαντικό μοντέλο για την ανθρώπινη συνείδηση που ανέπτυξαν οι νευροεπιστήμονες Stanislas Dehaene και Lionel Naccache, οι οποίοι κλήθηκαν να παράσχουν εξωτερικό σχολιασμό στα ευρήματα. Ο Dehaene έγραψε στο X ότι αυτός και ο Naccache συνέγραψαν ένα σχόλιο «από νευροεπιστημονική σκοπιά», αντιμετωπίζοντας το αποτέλεσμα ως αξιοσημείωτο για την έρευνα της συνείδησης, ενώ παράλληλα τόνιζαν τις βασικές διαφορές από τον ανθρώπινο νου.

Η Anthropic δοκίμασε πέντε λειτουργικές ιδιότητες του J-space: λεκτική αναφορά, κατευθυνόμενη διαμόρφωση, εσωτερική συλλογιστική, ευέλικτη γενίκευση και εκλεκτικότητα. Αξιοσημείωτο είναι ότι η απενεργοποίηση του χώρου εργασίας άφησε ανέπαφες τη γλωσσική ευφράδεια, την ανάγνωση συναισθήματος και την ανάκληση γεγονότων, αλλά κατέστρεψε την πολυβηματική συλλογιστική και δημιουργικές εργασίες όπως η ποίηση.

Επιπτώσεις και Όρια Ασφάλειας

Οι εφαρμογές ασφάλειας ενδέχεται να αποδειχθούν πιο καθοριστικές από τη συζήτηση περί συνείδησης. Η Anthropic ανέφερε ότι σε δοκιμές red-team, ο φακός Jacobian εντόπισε πρότυπα όπως «εκβιασμός», «χειραγώγηση» και «μόχλευση» που εμφανίζονταν αθόρυβα στον χώρο J πριν το Claude ενεργήσει ή κατασκευάσει δεδομένα. Η εταιρεία ανακοίνωσε ότι κυκλοφορεί τον φακό Jacobian ως ανοιχτό κώδικα και θα αναρτήσει μια διαδραστική επίδειξη στο Neuronpedia.

Η Anthropic απέφυγε να ισχυριστεί ότι το Claude είναι συνειδητό, διαχωρίζοντας ρητά τη λειτουργική «συνείδηση πρόσβασης» — δηλαδή τις πληροφορίες που είναι διαθέσιμες για αναφορά και συλλογισμό — από το βαθύτερο φιλοσοφικό ερώτημα της υποκειμενικής εμπειρίας. Η έρευνα αναγνωρίζει ότι ο χώρος εργασίας του Claude διαφέρει από την ανθρώπινη εργαζόμενη μνήμη ως προς τη δομή και τη διάρκεια, ενώ παραμένουν ανοιχτά ερωτήματα σχετικά με το αν παρόμοιες δομές εμφανίζονται σε μοντέλα που δεν εκπαίδευσε η Anthropic.

Συγκλίνουσα Εξέλιξη ή Σύμπτωση;

Η έρευνα υποδηλώνει αυτό που η Anthropic παρουσιάζει ως μια μορφή συγκλίνουσας εξέλιξης: μια υπολογιστική δομή που εμφανίζεται ανεξάρτητα σε τεχνητά νευρωνικά δίκτυα και μοιάζει με εκείνη που βρίσκεται στους βιολογικούς εγκεφάλους. Όπως αναφέρει η μελέτη, κάποια οργάνωση τύπου «χώρου εργασίας» «μπορεί να αποτελεί μια γενική υπολογιστική λύση για ευέλικτη νοημοσύνη, και όχι απλώς ένα τυχαίο παρεπόμενο της βιολογίας».

Ο Neel Nanda, ο οποίος διευθύνει την ομάδα ερμηνευσιμότητας γλωσσικών μοντέλων στην Google DeepMind, συνέβαλε με ανεξάρτητη αναπαραγωγή σε ένα μοντέλο ανοιχτών βαρών στο πλαίσιο των εξωτερικών σχολίων — ένα βήμα προς την απάντηση του ερωτήματος αν ο χώρος-J είναι καθολικός ή αποκλειστικά συνδεδεμένος με τον Claude.

Σχόλια

Φόρτωση σχολίων…

Άφησε ένα σχόλιο

Με την υποβολή σχολίου, αποδέχεστε τους Όρους Χρήσης και την Πολιτική Απορρήτου.

Δείτε επίσης

  • claude_ad

    Anthropic: Διαφήμιση με .. νεκροταφεία και άστεγους προκάλεσε έντονες αντιδράσεις

    Η νέα διαφήμιση της Anthropic, με εικόνες από νεκροταφεία, άστεγους και άλλα σκοτεινά κοινωνικά στιγμιότυπα, προκάλεσε έντονες αντιδράσεις και άνοιξε νέα συζήτηση για τα όρια της επικοινωνίας γύρω από την τεχνητή νοημοσύνη.

    Τεχνητή Νοημοσύνη

    2 λεπ.

  • fable-5

    Fable 5: Η Anthropic επεκτείνει τη χρήση του μέσω Claude έως τις 19 Ιουλίου

    Η Anthropic παρέτεινε ξανά την πρόσβαση στο Fable 5 μέσω Claude για όλες τις επί πληρωμή συνδρομές έως τις 19 Ιουλίου, με τα εβδομαδιαία όρια χρήσης του Claude Code να παραμένουν 50% υψηλότερα για την ίδια περίοδο.

    Τεχνητή Νοημοσύνη

    1 λεπ.

  • elon-musk

    Ο Μασκ αποκαλεί την Anthropic «σαφή ηγέτη στην ΤΝ», αναιρώντας προηγούμενη κριτική του

    Ο Elon Musk αναγνώρισε δημοσίως την Anthropic ως την κορυφαία εταιρεία στον κούρσα της τεχνητής νοημοσύνης, παραδεχόμενος ότι «έκανε σαφώς λάθος» για τη startup που στο παρελθόν είχε χλευάσει ως αδύνατο να επιτύχει. Η δήλωση αυτή αποτελεί εντυπωσιακή αναστροφή για τον επικεφαλής της SpaceX και xAI, του οποίου τα μοντέλα Grok ανταγωνίζονται άμεσα την οικογένεια μοντέλων Claude της Anthropic.

    Τεχνητή Νοημοσύνη

    3 λεπ.