Attendibilità

Come misuriamo ZeroEdge AI

Ogni funzione ha un banco di prova, ogni numero un verbale. Aggiornato al 07.10.2026.

In breve

  • Non pubblichiamo percentuali di marketing: pubblichiamo misure, con il metodo accanto. Quando rimisuriamo e il numero cambia, cambiamo il numero.
  • La regola che governa il prodotto: ogni promessa la mantiene il serverin modo verificabile, oppure la promessa si toglie.
  • Quello che non regge ancora lo trovi scritto qui sotto, nella sezione limiti aperti — prima che ce lo chiediate.

1. Il metodo

Ogni funzione viene provata su un banco: centinaia di domande a difficoltà graduata — da quelle che usano le parole esatte dei documenti a quelle formulate come le formula un professionista, senza nessuna parola in comune — più i controlli negativi: domande la cui risposta non esiste nel materiale, dove la risposta giusta è dirlo.

I risultati non li conta un programma che cerca parole: ogni risposta viene letta alla cieca da revisori indipendenti che non vedono il verdetto automatico, con una distinzione obbligatoria che i contatori automatici non sanno fare — quella fra il silenzio onesto («non l'ho trovato», sicuro) e la risposta sbagliata (un dato vero applicato alla pratica sbagliata, dannosa). Abbiamo imparato a nostre spese che un metro cieco a questa differenza dichiara pulito un prodotto che non lo è: è scritto nei nostri verbali, con le date.

I numeri di questa pagina sono stati rifatti il 21.09.2026 sul software in produzione e riletti il 22.09 con un metro corretto: alcuni sono scesi, altri saliti. Fa eccezione la riga ISO 27001, misurata il 06.10.2026 sul software in produzione. Qui trovate quelli di oggi, ciascuno con la sua base.

Ogni modifica si confronta con un braccio di controllo — il codice precedente, sulle stesse domande, letto dagli stessi revisori — e un miglioramento conta solo se supera la banda di rumore misurata del banco. Le modifiche che peggiorano i numeri non escono: nei verbali trovate anche quelle, con il motivo.

Anche il sapere di settore ha un metodo. Il modello non lo scrive: ogni pezzo del corpus lo prepara un agente di ricerca a partire da una fonte primaria — la legge nella raccolta ufficiale, la circolare dell'autorità, la norma internazionale — e un secondo agente, indipendente dal primo, lo ricontrolla riga per riga sulle fonti riscaricate. Nel corpus delle cure a domicilio i verificatori hanno corretto 198 record su 535, il 37%, senza doverne togliere nessuno: senza questo passaggio, più di un record su tre sarebbe entrato sbagliato. Ogni lotto lascia un verbale, e un terzo può ripeterlo.

2. I numeri, funzione per funzione

FunzioneChe cosa faMisuraIsolamento
I miei documentiDomande sui documenti dello studio, con citazioni apribiliFra 101 e 104 risposte giuste su 125 domande di fatto (81–83%) sui file veri dello studio — PDF anche scansionati, Word, Excel — e 6 astensioni corrette su 6 dove la risposta non c'era0 fughe di dati in 105 prove d'isolamento fra studi, utenti e mandati
Mandati (fascicoli)Conversazioni ristrette ai documenti di una praticaPerimetro garantito per costruzione dal server, non promesso dal modello; il briefing dichiara sempre quanti documenti ha lettoDocumenti privati per default; l'esistenza di un documento altrui non viene confermata
Legge e prassi — fiduciarieNorme, prassi AFC e cifre del mestiere, in perimetro dichiarato66% di risposte giuste con la norma giusta (77 su 117) e 75,5% di precisione sulle risposte date, col cancello di astensione attivo; sui controlli negativi, 21 astensioni corrette su 21 e nessuna risposta inventata. 15 su 15 sulle cifre ufficiali 2026 (aliquote, contributi, soglie)In questo perimetro i documenti dello studio non vengono letti, e nel perimetro dei documenti non entra la legge: le due fonti restano separate, e il confronto resta al professionista
Legge e prassi — cure a domicilioDiritto, finanziamento e prassi delle cure a domicilio in Ticino, per tutti i ruoli95,8% di risposte giuste e nessuna cifra sbagliata su 309 risposte (103 domande, tre giri); nel 3,9% la cifra è giusta ma la norma citata no, e una sola astensione. Lo stesso modello senza il corpus verificato: 8,4% giuste, 39,5% con la cifra sbagliata, 50,5% di astensioniOgni studio legge solo il corpus del proprio settore: le partizioni non si mescolano
Sicurezza delle informazioni — ISO 27001Requisiti e controlli ISO 27001, su norme internazionali e svizzere, con i rimedi quando li si chiede82,9% di risposte giuste su 624 risposte (52 domande, dodici giri), con una banda di confidenza fra 75,5% e 90,2%; 1,6% di risposte sbagliate, il resto astensioni dichiarate. Tre delle 52 domande non hanno risposta nel nostro corpus ISO e restano astensioni in tutti i dodici giri: sono dentro il numero, e si chiudono ampliando il corpus. Misurato il 06.10.2026 sul software in produzione. Il rilascio della stessa notte ha chiuso un difetto: una risposta giusta veniva respinta quando differiva dal testo di origine solo per il punto finale e richiamo omesso in coda — la punteggiatura e la virgoletta con cui si chiude una frase citata.Corpus costruito su norme internazionali, interrogate prima di quelle svizzere
Lavori sui fileApre i file interi, esegue il calcolo e consegna Excel con formule, Word, PowerPointSenza strumenti, nessun modello ha dato una sola cifra corretta: 0 su 144 in tre giri. Con il laboratorio, nel terzo giro: 16 cifre su 18, 3 risposte testuali su 4, 5 file su 5 consegnatiUn ambiente isolato per conversazione, senza accesso alla rete; in un mandato apre solo i documenti di quel mandato
La mia casellaDomande sulla propria posta, letta dal vivo via Microsoft 36551% di risposte utili su un banco di 154 domande a difficoltà crescente, in una casella di 600 messaggi; 2,8% di risposte errate sulle risposte date — il minimo misurato, con un controllo di corrispondenza domanda–fonte prima di ogni affermazione. Senza impronta dei messaggi, sulla stessa casella: 33% e 6,4%. Il resto sono silenzi dichiarati che elencano i messaggi più vicini, mai testo inventatoDella casella non conserviamo il testo: solo un'impronta matematica e la data di ogni messaggio, cancellate quando la scolleghi. Ogni risposta rilegge i messaggi dal vivo

Per confronto: una chat generalista di frontiera, messa sugli stessi compiti operativi del nostro banco, ne completa 0 su 23 — e ha identico al nostro il difetto più insidioso, il non dichiarare ciò che manca. La differenza non è il modello: è il server che dichiara perimetro, copertura e degrado a ogni risposta.

3. Che cosa dichiariamo, a ogni risposta

La nota di copertura apre ogni risposta di posta: quante email sono state esaminate, su che periodo, e se nessuna riguardava la domanda. Gli avvisi «Da verificare» segnalano le cifre che non compaiono nei passaggi letti. Se un documento attinge da più mandati, la risposta lo dice. Se una parte del lavoro è degradata — un corpo non letto, una finestra temporale caduta — la risposta lo dichiara invece di fingersi completa. Sono righe scritte dal server: il modello non può ometterle.

4. Limiti aperti

  • Sulla posta, il 3,5% delle risposte date contiene ancora un errore — tipicamente un dato vero attribuito alla pratica sbagliata. Due rimedi automatici sono stati provati e scartati con misura perché bocciavano risposte giuste; finché il numero non scende con un rimedio che regge, resta scritto qui.
  • Le domande formulate senza nessuna parola in comune con i documenti restano le più difficili (circa una su quattro trova la risposta): preferiamo un «non trovato» onesto a un'invenzione fluente.
  • I lavori sui file consegnano file da controllare prima di usarli. Sul banco del 16.09, estraendo gli importi da 40 fatture in PDF, il laboratorio li ha letti perdendo la virgola e ha dato un totale cento volte più grande — e la verifica di coerenza fatta dal modello stesso tornava lo stesso. Lettere e documenti restano bozze da rileggere.

Volete i verbali completi, con date, metodi e i rimedi bocciati? Scriveteci: è materiale che mostriamo volentieri.