Samuel Algherini
Il 24 luglio 2026 Anthropic ha rilasciato Claude Opus 5, presentato attraverso il consueto confronto di benchmark su coding, ragionamento e task agentici: Frontier-Bench, ARC-AGI 3, OSWorld 2.0, e così via. È il tipo di comunicazione che ci si aspetta dal lancio di un modello. Tutto nella norma. Nello stesso documento di rilascio, però, compaiono tre punti che meritano più attenzione delle prestazioni tecniche. Riguardano allineamento, cybersicurezza e rischio biologico (da uso improprio nella creazione di armi chimiche o biologiche). Lette insieme, mostrano il tipo di architettura di gestione del rischio che Anthropic sta costruendo: un sistema a più livelli, con soglie che cambiano da compito a compito, più simile a un termostato (regolazione graduale e continua) che a un interruttore acceso o spento. Questa architettura sarà molto probabilmente il default dei futuri modelli di frontiera e dunque merita, specialmente essendo solo parzialmente trasparente, doverosa attenzione. Iniziamo vedendo i tre punti sopra citati.
Allineamento: ridurre uso improprio
Nell’audit comportamentale automatizzato che Anthropic conduce prima del rilascio, Opus 5 ottiene il punteggio più basso di sempre su “comportamento disallineato” tra i modelli recenti (2.3, contro modelli precedenti collocati più in alto sulla stessa scala). Tradotto: meno episodi di inganno rilevati, minore vulnerabilità a essere manipolato per usi impropri, minore propensione ad azioni rischiose dagli effetti difficili da invertire.
Il dato è positivo, ma va sempre contestualizzato e preso con le dovute precauzioni: è un audit interno, con metodologia e criteri di misurazione definiti dalla stessa azienda che produce il modello. Anthropic, si legge nella system card, ha usato un mix di metodi, prevalentemente interni, integrati da alcuni benchmark pubblici e da testing esterno indipendente. Non è disponibile, ad esempio, la rubrica di classificazione dettagliata – cosa distingue esattamente “comportamento scorretto ma accettabile” da “concerning behavior”- oppure le soglie numeriche esatte che fanno scattare una classificazione come “sandbagging”, “deception”, “oversight evasion” ecc.
Le scelte fatte nel creare il framework di valutazione sono inevitabilmente umane, temporalmente e spazialmente locate, e su parte di esse non abbiamo visibilità.
Cybersicurezza: trovare ma non sfruttare
Il dato più interessante sulla cybersicurezza riguarda dove Anthropic ha scelto di limitare deliberatamente il modello, ovvero nello sfruttare le falle di sicurezza trovate dal sistema. Sul benchmark interno OSS-Fuzz, che misura la capacità di trovare e poi sfruttare vulnerabilità software senza guida umana estesa, Opus 5 le individua con un’efficacia paragonabile a Mythos 5, il modello più capace (e ad accesso ristretto) di Anthropic. Questa capacità è emersa senza training dedicato, come “semplice” effetto collaterale dell’aumento generale delle competenze del modello.
Quando bisogna poi però sfruttare tali vulnerabilità, Opus 5 resta però più indietro rispetto a Mythos 5. Anthropic qui dichiara esplicitamente di aver evitato di allenare il modello su questo tipo di task. È una scelta di design, dichiarata come tale.
Tale scelta si riflette anche nei classificatori di sicurezza applicati al modello, che consentono di trovare bug nel codice sorgente ma bloccano la scansione binaria, il penetration testing e la generazione di exploit. Anthropic stima che questi classificatori intervengano circa l’85% in meno rispetto a quelli applicati a Fable 5. Quando una richiesta viene segnalata, viene instradata automaticamente verso un modello con più restrizioni (Opus 4.8 di default), mentre aziende e ricercatori verificati attraverso il Cyber Verification Program di Anthropic possono accedere a una versione con meno vincoli.
Biologia: capacità autonoma limitata su task lunghi
Sul fronte “biologico” si ripete la stessa logica. Opus 5 è il modello generalmente disponibile più capace di Anthropic per la ricerca scientifica, ma mantiene limiti intenzionali sui task di ricerca autonoma a lungo termine, cioè proprio dove Anthropic stessa colloca il rischio biologico più concreto. Anche qui, Mythos 5 resta il modello più capace (sempre con accesso ristretto).
Un dettaglio da notare: le richieste in ambito biologico che venivano bloccate su Fable 5 ora vengono instradate su Opus 5 anziché su Opus 4.8. La soglia si sposta insieme al modello considerato “abbastanza sicuro” per quel livello di richiesta.
Capacità e permesso non coincidono
Nei tre punti visti finora torna uno stesso schema. Da un lato c’è quello che il modello sa fare, o potrebbe arrivare a fare: trovare una vulnerabilità, condurre ricerca scientifica, valutare uno scenario rischioso. Dall’altro c’è quello che gli viene permesso di fare: generare l’exploit, condurre ricerca autonoma a lungo termine, agire senza restrizioni aggiuntive. I due piani non coincidono, e nel caso di Opus 5 la distanza è ben documentata: il modello trova le vulnerabilità quasi quanto Mythos 5, ma resta indietro nello sfruttarle, non per un limite tecnico, semplicemente perché non è stato allenato a farlo.
A tracciare il confine tra i due piani, e a decidere quando spostarlo, è l’azienda che sviluppa il modello. È lei a stabilire quali classificatori intervengono, quali richieste vengono bloccate, quali instradate su un modello con più o meno restrizioni. Ed è sempre lei a decidere quando allargare l’accesso: le richieste biologiche che fino a poco tempo fa venivano bloccate su Fable 5 ora passano su Opus 5 invece che su Opus 4.8, segno che la soglia si è spostata con il nuovo rilascio.
Ne consegue che la distinzione tra cosa un modello può fare e cosa gli è concesso fare, in questo momento, non la decidiamo noi. Lo decide a monte l’azienda che lo produce. Per la biologia, Anthropic dichiara di aver condotto le valutazioni “alongside private-sector and government partners”: una collaborazione con soggetti esterni che vale la pena registrare, anche se il testo non specifica se riguardi anche la decisione finale sulla soglia o solo la fase di valutazione.
C’è un’immagine, diffusa e rassicurante, del modello come di un blocco neutro che ciascuno plasma secondo le proprie esigenze, quasi fosse materia grezza da customizzare in azienda. Il caso di Opus 5 mostra quanto questa immagine sia parziale. Un modello arriva già configurato rispetto a ciò che considera un comportamento accettabile, e già dotato di una soglia, per quanto mobile, tra ciò che è lecito concedere e ciò che va bloccato o instradato altrove; una configurazione, va detto, che non discende dall’uso che ne facciamo una volta ricevuto, ma che viene decisa prima, da chi lo costruisce.
Resta chiaro che comunque la possibilità di customizzazione del modello è reale, ed è quello che lo rende utile per il caso d’uso specifico. Ma si tratta di un lavoro che si svolge sempre entro un perimetro già definito da altri. I confini che contano di più, quelli che stabiliscono a monte dove spostare la soglia tra rischio accettabile e rischio da respingere, restano nella disponibilità di un numero ristretto di aziende private.
Va detto che questi processi non sono del tutto opachi. Le principali aziende del settore hanno pubblicato framework che rendono almeno in parte visibili i criteri con cui classificano i rischi, definiscono le soglie di intervento e giustificano le proprie decisioni. È una visibilità limitata, ma reale. Quello che emerge con quest’ultimo rilascio è come l’attenzione si sposti sempre di più da cosa un modello sa fare a cosa non gli è permesso fare: le soglie e i valori precisi su cui si fonda quella distinzione restano in parte non dichiarati, ed è in quello spazio meno visibile che si decide buona parte del comportamento reale di uno strumento.



