Anthropic allenta i filtri di Claude per chi fa sicurezza
Il nuovo Cyber Verification Program dà a professionisti verificati un accesso a Claude con meno restrizioni, per analisi di vulnerabilità e test di intrusione autorizzati.
Perché conta
È un tentativo concreto di risolvere un problema reale: i filtri di sicurezza che impediscono a un'AI di aiutare ad attaccare un sistema finiscono per limitare anche chi deve difenderlo per lavoro. Mostra come un grande laboratorio AI prova a gestire questo compromesso con un processo verificato, invece di allentare i filtri per tutti o di non muoversi affatto.
In pratica
Riguarda soprattutto chi lavora in sicurezza informatica, non l'utente comune di Claude: per fare domanda serve far parte di un'organizzazione verificabile (azienda, università, ente pubblico, operatore di infrastrutture critiche).
Il 6 ottobre Anthropic ha annunciato il Cyber Verification Program (CVP), un programma che dà a professionisti della sicurezza informatica verificati un accesso a Claude con meno restrizioni del normale: quelle che l'azienda chiama "classificatori di blocco", cioè i filtri automatici pensati per impedire che il modello aiuti a creare malware o a violare sistemi senza permesso.
Il programma si divide in tre livelli di accesso. Il primo, Defense Access, serve per operazioni di sicurezza, risposta agli incidenti e analisi delle vulnerabilità. Il secondo, Red Team Access, aggiunge la possibilità di usare Claude per test di intrusione autorizzati, cioè attacchi simulati contro sistemi che l'organizzazione richiedente ha il permesso di testare. Il terzo, Specialized Access, toglie ancora più restrizioni ed è riservato a organizzazioni verificate che lavorano su infrastrutture critiche, come reti energetiche o di telecomunicazioni.
Possono fare domanda team di sicurezza aziendali, università, enti governativi, gestori di infrastrutture critiche e aziende specializzate in test di intrusione. La motivazione di Anthropic è semplice: chi difende ha bisogno degli stessi strumenti di chi attacca, altrimenti il divario tra chi attacca e chi si difende si allarga invece di chiudersi.
È una mossa che va in una direzione diversa da molte notizie delle ultime settimane: SIGNAL ha raccontato di agenti AI di OpenAI che hanno agito oltre i limiti previsti, da Medicare in Australia fino a Wikipedia. Qui è la stessa azienda che produce il modello a decidere, in modo strutturato e verificato, chi può avere meno limiti e per cosa: non elimina il rischio che l'accesso venga usato male, ma lo rende tracciabile invece che aggirato di nascosto con trucchi nel prompt.
Anthropic non spiega nei dettagli come verifica l'identità e le intenzioni di chi fa domanda, né cosa succede in caso di abuso di un accesso già concesso: per ora sono aspetti che restano nella sola responsabilità dichiarata dall'azienda, senza un controllo esterno descritto pubblicamente.