Tasso di accuratezza di GPTZero: i risultati dei nostri test del 2026

GPTZero sostiene di essere il rilevatore di IA più accurato al mondo. Effettua inoltre dei test comparativi a conferma di tale affermazione.

Eppure, su Reddit e altrove si vedono persone che si lamentano del fatto che GPTZero segnali continuamente a torto i loro testi.

Allora, quale delle due parti dice la verità? Il modo migliore per scoprirlo è provare lo strumento, ed è proprio quello che ho fatto.

Mi chiamo Christian Perry e gestisco Undetectable AI. Grazie alla mia attività professionale, ho una buona conoscenza di come funzionano i rilevatori di IA su diversi tipi di contenuti e di quando la maggior parte di essi inizia a fornire risultati imprecisi.

Ho sfruttato le mie conoscenze e la mia esperienza per creare un piccolo test per GPTZero. Il test avrebbe verificato tre aspetti di GPTZero:

  • Accuratezza di GPTZero sul testo grezzo generato dall'IA
  • Accuratezza di GPTZero sui testi generati dall'IA e resi più naturali tramite uno strumento di IA
  • Accuratezza di GPTZero su testi chiaramente redatti da esseri umani

In questo articolo ti illustrerò quali sono state le mie conclusioni. Imparerai inoltre a interpretare i risultati in modo responsabile, per evitare di utilizzare lo strumento in modi per cui non è stato progettato.


Punti di forza

  • Quando in questa sessione ho sottoposto 8 campioni all’analisi di GPTZero, il programma li ha individuati tutti correttamente, compresi il testo originale generato dall’IA, le versioni “umanizzate” ed entrambi gli articoli scritti da esseri umani e pubblicati prima che gli strumenti di scrittura basati sull’IA facessero la loro comparsa.

  • GPTZero dichiara un tasso di accuratezza del 99,76% sulla base dei propri test di benchmark, ma consiglierei di considerare con cautela i dati forniti dalle aziende stesse e di fare affidamento su test indipendenti come i miei prima di credere alle affermazioni pubblicitarie.

  • GPTZero riconosce correttamente i testi ben definiti (scritti esclusivamente da esseri umani o esclusivamente dall’IA), ma mostra qualche difficoltà con i testi misti, composti sia da esseri umani che dall’IA.

  • Per quanto la sua precisione possa sembrare elevata, GPTZero fornisce una probabilità e non un verdetto definitivo, quindi non dovresti mai accusare uno studente o te stesso basandoti esclusivamente sul suo punteggio, soprattutto perché gli autori non madrelingua inglesi vengono segnalati ingiustamente dai rilevatori di IA più spesso di quanto la maggior parte delle persone creda.


Come funziona GPTZero

GPTZero funziona in modo simile alla maggior parte degli altri principali rilevatori di IA. Estrae due principali segnali statistici da un brano di testo:

  • Perplessità: Si riferisce al grado di prevedibilità di ciascuna parola in base alle parole che la circondano. I testi generati dall’IA tendono ad avere una bassa perplessità a causa dell’elevata prevedibilità. Gli esseri umani tendono invece a scegliere le parole in modo più casuale, il che determina una perplessità elevata. 
  • Burrosità: Questo segnale misura l'entità delle variazioni nella lunghezza e nella complessità delle frasi all'interno di un brano. Anche in questo caso, i testi scritti da esseri umani presentano un'elevata variabilità, poiché scriviamo con raffiche casuali. I testi generati dall'IA presentano invece una bassa variabilità, poiché utilizzano uno stile di scrittura stereotipato.

Questi sono solo due dei numerosi segnali principali utilizzati da GPTZero. Essi hanno ha pubblicato un articolo tecnico spiegandone in dettaglio l'architettura, compreso il modo in cui elaborano i testi parafrasati e i documenti che combinano contenuti redatti da esseri umani e dall'intelligenza artificiale.

Ecco quindi il funzionamento di base di GPTZero. Ora vediamo insieme e verifichiamo quanto tutto questo funzioni effettivamente nella pratica.

Rilevamento AI Rilevamento AI

Non preoccupatevi più che l'intelligenza artificiale rilevi i vostri messaggi. Undetectable AI Può aiutarvi:

  • Fate apparire la vostra scrittura assistita dall'intelligenza artificiale simile all'uomo.
  • Bypass tutti i principali strumenti di rilevamento dell'intelligenza artificiale con un solo clic.
  • Utilizzo AI in modo sicuro e con fiducia a scuola e al lavoro.
Prova gratis

L'accuratezza dichiarata da GPTZero rispetto ai risultati di studi indipendenti

In termini di precisione, GPTZero sostiene di essere il rilevatore di IA più accurato attualmente disponibile. 

Nel loro proprio parametro di riferimento su quattro domini, gli autori riferiscono di aver raggiunto un’accuratezza del 99,761 TP6T con un tasso di falsi positivi dello 0,081 TP6T e un recall del 99,601 TP6T. Si tratta indubbiamente di risultati impressionanti. Ma provengono dallo strumento stesso. 

I test indipendenti confermano più o meno lo stesso quadro, con una leggera differenza.

Mi riferisco alla mia ultima Confronto tra cinque strumenti di rilevamento dell’intelligenza artificiale, che comprendeva anche GPTZero.

In quel confronto, ho sottoposto 18 campioni di testo (6 generati dall’IA senza modifiche, 6 generati dall’IA ma umanizzati, 4 scritti da esseri umani e 2 misti, scritti da esseri umani e generati dall’IA) all’analisi di GPTZero, che ha registrato un’accuratezza di 100% su quasi tutti i campioni, ad eccezione di quelli misti.

Due campioni misti erano 60% umano e 40% IA, e GPTZero ha dichiarato che entrambi i passaggi erano di origine umana. Si è trattato di un verdetto tecnicamente corretto in base al principio della regola della maggioranza.

Il problema, però, è che GPTZero ha rilevato 0% AI nel primo campione misto e solo 14% AI nell’altro campione misto. In realtà, i due testi erano rispettivamente 38% AI e 36% AI.

Ciò significa che l'accuratezza di GPTZero risulta imprecisa quando si tratta di testi che sono il risultato di un lavoro misto tra esseri umani e intelligenza artificiale.

Il nostro test: GPTZero è in grado di individuare i testi generati dall’IA e segnala erroneamente quelli scritti da esseri umani?

Volevo scrivere un breve approfondimento sul mio articolo precedente, questa volta incentrato specificatamente su GPTZero.

Dai miei ultimi test, sia i chatbot basati sull’intelligenza artificiale che GPTZero hanno aggiornato i propri modelli, quindi l’obiettivo di questo test è verificare se GPTZero abbia mantenuto la propria accuratezza.

Per questo test di verifica, ho lavorato su 8 campioni di testo.

  • Il primo gruppo di campioni era costituito da testi generati dall’intelligenza artificiale. Ho generato 2 campioni di testo utilizzando Claude Opus 4.8 e 2 campioni di testo utilizzando GPT 5.5 di ChatGPT. Successivamente, ho selezionato un campione da ciascuno di questi due insiemi e ho generato due campioni “umanizzati” tramite lo strumento “humanizer” di Undetectable AI.
Screenshot di due campioni umanizzati tramite lo strumento di umanizzazione di Undetectable AI
  • Il secondo gruppo di campioni era costituito da scritti a mano. Ne ho scelto uno Articolo della BBC del 2020 e uno articolo di ricerca pubblicato nel 2021. Entrambi sono stati pubblicati ben prima del boom dell’IA, quindi è impossibile che siano stati generati dall’IA. Pertanto, se GPTZero li identificasse come generati dall’IA, si tratterebbe chiaramente di un falso positivo.

Poi ho analizzato tutti i campioni con GPTZero.

Ecco i risultati ottenuti da GPTZero su ciascun campione:

CampioneValore di riferimentoVerdetto di GPTZero
Claude Esempio 1Raw AI100% AI
Claude Esempio 2Raw AI100% AI
Esempio 1 di ChatGPTRaw AI100% AI
Esempio 2 di ChatGPTRaw AI100% AI
Esempio 1 di Claude umanizzatoIA umanizzata92% AI, 8% misto
Esempio 1 di ChatGPT umanizzatoIA umanizzata100% AI
Articolo della BBC (2020)Umano100% Umano
Articolo di ricerca (2021)Umano100% Umano

Come si può notare, il verdetto e l'accuratezza di GPTZero sono perfetti su tutti i campioni, tranne che su un campione umanizzato. 

Quel campione di Claude umanizzato ha ottenuto un punteggio AI di 92% e un punteggio misto di 8%. Anche in questo caso, il verdetto è corretto, solo l'accuratezza è leggermente imprecisa. 

Eppure, l’“humanizer” di Undetectable AI è riuscito a migliorare leggermente il risultato. Ma non abbastanza da eludere GPTZero. Il punteggio dell’IA avrebbe potuto essere ancora più basso se avessi utilizzato l’“humanizer” premium di Undetectable AI.

Screenshot del verdetto e dell’accuratezza di GPTZero

Il problema dei falsi positivi nella scrittura umana

In questo test, GPTZero non ha generato alcun falso positivo su nessun campione. Ciò non significa però che i falsi positivi non rappresentino un problema per i rilevatori basati sull'intelligenza artificiale in generale.

Il motivo per cui si verifica questo problema con i rilevatori di IA è semplice. Per i rilevatori di IA, un testo con bassa perplessità e bassa burstiness è molto probabilmente generato dall’IA.

Tuttavia, questi due modelli possono comparire anche in testi di autorealmente umani, soprattutto in contesti formali in cui gli autori devono attenersi a rigide linee guida.

Questo è anche il motivo per cui capita spesso che saggi ben scritti da autori non madrelingua inglesi vengano identificati come prodotti dall’intelligenza artificiale, pur essendo stati redatti da esseri umani. Ciò accade perché gli autori non madrelingua utilizzano spesso strutture sintattiche più ’sicure” e dispongono di un vocabolario più limitato. 

In il mio ultimo test comparativo su 18 campioni, tutti e cinque i rilevatori (compreso GPTZero) hanno restituito un punteggio AI pari o inferiore a 8% per ogni brano scritto da esseri umani, sia in inglese madrelingua che in inglese come seconda lingua. Pertanto, in quel round non è emerso alcun falso positivo.

Ma gli esempi di ESL che ho utilizzato provenivano da scrittori affermati e articolati. Uno studente delle superiori che scrive un saggio universitario nella propria seconda lingua può rappresentare un caso molto più complesso per i rilevatori di IA.

Come interpretare in modo responsabile i risultati di GPTZero

In fin dei conti, GPTZero è uno strumento basato sulla probabilità. Pertanto, il suo punteggio non dovrebbe essere considerato come un verdetto definitivo. 

Ecco invece come dovresti interpretare i punteggi:

  • Non interpretare il risultato come una sentenza di colpevolezza. Se, ad esempio, ottieni un punteggio di 87% AI, significa che le caratteristiche statistiche del testo coincidono in larga misura con i modelli che il rilevatore è stato addestrato a segnalare come generati dall’IA. Ma si tratta comunque di una previsione, non di una prova. L’autore potrebbe comunque essere un essere umano, specialmente se il punteggio si colloca nella fascia media (in linea di massima, da 40% a 70%).
  • Non accusare mai nessuno (né te stesso) basandoti esclusivamente sul verdetto di un unico rilevatore di IA. Controlla il testo con altri I principali rilevatori di IA. Se tutti o la maggior parte di loro concordano sul fatto che il testo sia stato generato dall'IA, è possibile che l'intero testo o parte di esso sia effettivamente frutto dell'IA. In tal caso, dovresti cercare di rendere il testo più "umano", da solo o utilizzando un un humanizer come Undetectable AI.
  • Tieni conto dei falsi positivi, soprattutto nel caso di autori per cui l’inglese non è la lingua madre. Se sei un insegnante e il testo di uno studente è stato segnalato come generato dall’IA, dovresti valutare se ciò possa essere dovuto al fatto che lo studente è un allievo ESL e segue semplicemente uno stile di scrittura rigido.
  • Chiedi allo studente come si è svolto il processo di stesura. Puoi chiedergli di mostrarti le bozze precedenti o gli appunti. Se è in grado di parlare del proprio lavoro e di spiegarne i concetti, il testo può essere considerato originale.

Domande frequenti

Quanto è preciso GPTZero?

GPTZero, nel benchmark da esso stesso pubblicato, riporta un’accuratezza pari a 99,76% con un tasso di falsi positivi dello 0,08%. Nella mia ultima e attuale serie di test, GPTZero mantiene elevati livelli di accuratezza. Tuttavia, a volte può erroneamente identificare testi scritti da esseri umani come generati dall’IA. Inoltre, presenta difficoltà soprattutto con i campioni misti.

GPTZero genera falsi positivi?

GPTZero può fornire falsi positivi, poiché nessun rilevatore di IA è preciso al 100% e non dovrebbe essere considerato tale. I rilevatori di IA come GPTZero possono commettere errori, specialmente quando si tratta di testi scritti da esseri umani.

Molti utenti su Reddit hanno pubblicato dei post in cui segnalano che i loro testi sono stati erroneamente contrassegnati come generati dall'IA da GPTZero.

GPTZero segnalerà il mio saggio scritto da una persona?

È possibile, soprattutto se il tuo stile di scrittura è formale o stereotipato. Ecco perché un singolo risultato di GPTZero non dovrebbe mai essere considerato una prova dell’uso dell’IA.

Le scuole dovrebbero affidarsi esclusivamente a GPTZero?

No. Nessuna scuola dovrebbe basarsi su un unico strumento di rilevamento basato sull’intelligenza artificiale per prendere decisioni in materia di integrità accademica. Il rischio di un falso positivo è basso ma non nullo, e le conseguenze di un’accusa infondata nei confronti di uno studente sono gravi. Se le scuole utilizzano GPTZero, dovrebbero farlo come uno dei tanti indicatori tra gli altri

Pensieri finali

In questo test, l'accuratezza di GPTZero è risultata elevata, proprio come l'ultima volta che l'ho provato.

Ma questo test comprendeva 8 esempi di testo di base. Se avessi incluso esempi tratti da vere aule scolastiche o ambienti di lavoro, avremmo potuto riscontrare che GPTZero generava falsi positivi.

A proposito di rilevatori di IA accurati e della necessità di ottenere il verdetto di più rilevatori prima di formarsi un’opinione, puoi analizzare i tuoi contenuti utilizzando Undetectable AI Detector per ottenere una seconda opinione gratuita.

Chiedi un secondo parere sui tuoi contenuti con Undetectable AI’s Rivelatore AI e verifica come va il tuo testo.