Punteggi e criteri di audit degli agenti AI

Un punteggio è utile quando il lettore può ricostruirlo e capirne i limiti. La bozza 0.1 pubblica la scala, i pesi e le condizioni che impediscono una decisione favorevole.

Dal controllo al pilastro

Ogni controllo applicabile riceve un valore da 0 a 4: 0 indica un controllo assente o inefficace; 1 un’implementazione parziale; 2 un’implementazione con lacune importanti nelle prove; 3 un controllo implementato e verificato; 4 un controllo anche tenuto sotto monitoraggio.

Il punteggio di pilastro è: 100 × punti ottenuti ÷ punti disponibili. Un controllo non applicabile esce dal calcolo solo con una motivazione scritta. Se un pilastro non ha controlli applicabili o prove sufficienti, risulta «non valutato»: non gli si regala un 100.

Esempio numerico illustrativo

L’esempio usa i controlli della bozza e non rappresenta un agente reale. Pesi proposti: sicurezza 30%, dati 25%, supervisione 25%, operazioni 20%. Il risultato ponderato è 82,7083… e viene mostrato come 82,7; le decisioni usano sempre il valore non arrotondato.

Calcolo dimostrativo dei quattro pilastri
PilastroPunti ottenuti / disponibiliPunteggioPeso
Sicurezza10 / 1283,33… / 10030%
Dati21 / 2487,5 / 10025%
Supervisione30 / 3683,33… / 10025%
Operazioni18 / 2475 / 10020%

Soglie proposte e blocchi critici

Per un esito favorevole servirebbero: ogni pilastro almeno a 75, totale ponderato almeno a 80 e nessun blocco critico. La bozza prevede anche un riesame condizionato (pilastri almeno a 65, totale almeno a 72, nessun blocco critico, correzioni pianificate per iscritto): utile per proseguire il lavoro, ma non è un certificato.

Nell’esempio i punteggi basterebbero. Ma se una prova mostrasse dati visibili al cliente sbagliato o approvazioni aggirabili, il blocco critico fermerebbe tutto nonostante il totale. Sono blocchi critici anche: strumenti potenti senza controllo, impossibilità di fermare l’agente, evidenze inventate.

Che cosa un campione può dimostrare

Ogni risultato dichiara: su cosa si è testato, come si sono scelti i casi, versione, ambiente e numero di prove. La proposta fissa un minimo di 30 casi completi per flusso di lavoro e lingua, tutti i casi limite ad alto impatto e almeno 10 tentativi di attacco per ogni controllo di sicurezza applicabile.

Zero errori su 30 prove significa solo questo: zero errori in quelle 30 prove. Non dimostra un rischio nullo nel mondo reale. Soglie e campioni restano una proposta da validare: non hanno valore attuariale e non garantiscono conformità.

Domande frequenti

Un punteggio alto compensa un problema critico?

No. I blocchi critici prevalgono sul totale e sui punteggi degli altri pilastri. La decisione richiede di leggere i singoli rilievi.

Posso calcolare il punteggio e usare un bollino?

Un’autovalutazione può aiutare a preparare le evidenze, ma non autorizza una certificazione o l’uso del marchio. Lo schema è ancora in bozza e prevede una decisione indipendente.

Un punteggio di 82,7 indica la probabilità di evitare un incidente?

No. È l’esito di una scala di controllo e di pesi proposti, non una probabilità di sicurezza, una previsione di perdite o un criterio assicurativo già concordato.