I rilevatori di IA possono essere utili per identificare gli schemi che ricorrono comunemente nei testi generati dall'IA, ma nessun rilevatore è accurato al 100% in ogni situazione.
Ma allora, i rilevatori di IA sono precisi? La risposta dipende dallo strumento utilizzato, dal tipo e dalla lunghezza del testo sottoposto a verifica, dal modello di IA utilizzato per generarlo e dal fatto che il contenuto sia stato modificato o parafrasato.
I moderni modelli di intelligenza artificiale sono in grado di produrre testi che assomigliano molto a quelli scritti dall’uomo, mentre i testi scritti dall’uomo possono talvolta apparire così prevedibili da far scattare un rilevatore di IA. Ciò crea due problemi ricorrenti: i falsi positivi, in cui un testo scritto dall’uomo viene segnalato come generato dall’IA, e i falsi negativi, in cui un testo generato dall’IA viene classificato come scritto dall’uomo.
Per valutare le prestazioni dei diversi strumenti, abbiamo testato 10 popolari rilevatori di IA utilizzando lo stesso benchmark composto da cinque testi. L'obiettivo non era dimostrare che un rilevatore fosse universalmente accurato, ma confrontare la costanza delle loro prestazioni nelle stesse condizioni.
Ecco cosa abbiamo scoperto.
Punti di forza
- I rilevatori di IA individuano modelli quali la prevedibilità delle parole, la varietà delle frasi, la sintassi e altre caratteristiche associate ai testi generati dall’IA.
- Nessun rilevatore di IA è completamente affidabile. Possono verificarsi falsi positivi e falsi negativi, soprattutto nel caso di testi brevi, modificati o altamente prevedibili.
- Il nostro test su cinque campioni ha evidenziato notevoli differenze tra i vari rilevatori: alcuni strumenti hanno classificato correttamente tutti e cinque i campioni, mentre altri ne hanno tralasciato uno o più.
- Il punteggio assegnato dal sistema di rilevamento dovrebbe essere considerato un indicatore, non una prova definitiva dell'autore di un contenuto.
- Per ottenere risultati migliori, analizza campioni più lunghi, confronta i risultati ottenuti con diversi strumenti e tieni conto di come il contenuto è stato creato e modificato.
Cosa sono i rilevatori di intelligenza artificiale e come funzionano?
I rilevatori di IA sono strumenti progettati per valutare se un testo sia stato scritto da un essere umano o generato dall'intelligenza artificiale.
Anziché individuare un’etichetta nascosta con la dicitura “Generato dall’IA”, la maggior parte dei sistemi di rilevamento analizza le caratteristiche intrinseche del testo. Tra queste possono figurare la scelta lessicale, la struttura delle frasi, la prevedibilità, la sintassi e gli schemi appresi da vaste raccolte di testi generati sia da esseri umani che dall’IA.
Scrittura generata dall'intelligenza artificiale possono presentare modelli statistici che differiscono dalla scrittura umana tipica. Poiché i modelli linguistici generano testo prevedendo sequenze probabili di parole, il risultato che ne deriva può talvolta apparire più prevedibile o coerente rispetto a un contenuto scritto in modo naturale.
Non preoccupatevi più che l'intelligenza artificiale rilevi i vostri messaggi. Undetectable AI Può aiutarvi:
- Fate apparire la vostra scrittura assistita dall'intelligenza artificiale simile all'uomo.
- Bypass tutti i principali strumenti di rilevamento dell'intelligenza artificiale con un solo clic.
- Utilizzo AI in modo sicuro e con fiducia a scuola e al lavoro.
Due concetti comunemente associati al rilevamento dell'IA sono la perplessità e la burstiness.
Perplessità
La perplessità misura quanto una sequenza di parole sia prevedibile per un modello linguistico.
Un punteggio di perplessità più basso indica generalmente che la formulazione è più facile da prevedere. I testi generati dall'IA possono talvolta presentare una perplessità più bassa, poiché i modelli linguistici tendono a selezionare sequenze di parole statisticamente probabili.
Gli autori umani sono meno coerenti. Possono ricorrere a espressioni insolite, scelte lessicali inaspettate, formulazioni personali o strutture sintattiche più difficili da prevedere.
Tuttavia, la perplessità di per sé non è sufficiente a dimostrare in modo attendibile la paternità di un testo. Anche la scrittura umana può essere altamente prevedibile, in particolare quando l’argomento è tecnico, formale o ripetitivo.
Irruenza
Il concetto di "burstiness" descrive la variabilità nella lunghezza, nella struttura e nel ritmo delle frasi.
La scrittura umana contiene spesso un misto di frasi brevi e lunghe. I testi generati dall'intelligenza artificiale possono talvolta apparire più uniformi, con strutture sintattiche e un ritmo simili in tutto il brano.
I modelli linguistici moderni sono però diventati molto più efficaci nel variare i propri risultati. Ciò rende la “burstiness” meno utile come segnale a sé stante ed è uno dei motivi per cui l’attuale rilevamento dell’IA si basa in genere su più segnali piuttosto che su una singola misurazione.
Perché il rilevamento dell'IA è così difficile
L'idea alla base del rilevamento dell'intelligenza artificiale sembra semplice: identificare gli schemi che distinguono la scrittura umana da quella generata da una macchina.
In pratica, il confine è molto meno netto.
La scrittura umana e quella generata dall'IA utilizzano lo stesso linguaggio. I modelli di IA vengono addestrati su materiale creato dall'uomo, quindi apprendono molte delle stesse strutture grammaticali, degli stessi schemi lessicali e delle stesse convenzioni di scrittura utilizzate dalle persone.
Ciò pone diverse sfide ai sistemi di rilevamento.
La scrittura umana e quella generata dall'intelligenza artificiale possono sembrare simili
I modelli di intelligenza artificiale sono progettati per generare linguaggio naturale. Man mano che i modelli migliorano, i testi che producono possono diventare meno ripetitivi e più sensibili al contesto.
Allo stesso tempo, spesso le persone scrivono in modo prevedibile. La scrittura accademica, la comunicazione aziendale, le descrizioni dei prodotti e la documentazione tecnica possono seguire strutture consolidate che un rilevatore di IA potrebbe interpretare come generate da una macchina.
Ciò significa che un rilevatore non si limita a chiedersi: “Questo suona come se fosse generato dall’IA?”
Sta valutando se le caratteristiche statistiche e linguistiche del testo siano più coerenti con i modelli che associa ai contenuti generati dall'intelligenza artificiale.
Falsi positivi e falsi negativi
Si verifica un falso positivo quando un testo scritto da una persona viene erroneamente classificato come generato dall'IA.
Un falso negativo è l'opposto. Il testo generato dall'IA viene classificato come scritto da un essere umano.
Entrambe sono importanti.
Un falso positivo può causare problemi quando qualcuno viene accusato di aver utilizzato l'IA pur avendo scritto il contenuto di proprio pugno. Un falso negativo può consentire a materiale generato dall'IA di superare un sistema di rilevamento senza essere segnalato.
La ricerca ha inoltre evidenziato che le prestazioni dei sistemi di rilevamento possono variare in modo significativo a seconda del tipo di testo, del modello utilizzato e del fatto che il contenuto sia stato modificato o meno.
I modelli di IA sono in continua evoluzione
Il rilevamento dell’IA è un obiettivo in continua evoluzione, poiché i sistemi che generano il testo cambiano continuamente.
I modelli di IA più datati producevano spesso schemi più evidenti, tra cui frasi ripetitive e strutture prevedibili. I modelli più recenti sono in grado di produrre testi più vari e di seguire più da vicino il contesto.
Ciò non significa che i contenuti moderni generati dall’intelligenza artificiale siano impossibili da individuare. Significa piuttosto che gli sviluppatori dei sistemi di rilevamento devono aggiornare continuamente i propri sistemi per tenere conto dei nuovi modelli e dei nuovi schemi di scrittura.
Quanto sono precisi oggi i rilevatori di IA?
Non esiste un unico valore di precisione valido per tutti i rilevatori di IA.
Uno strumento potrebbe funzionare molto bene su testi generati dall’IA senza modifiche, ma avere difficoltà con contenuti parafrasati o modificati da esseri umani. Un altro rilevatore potrebbe essere più prudente e generare meno falsi positivi, ma non individuare alcuni passaggi generati dall’IA.
Ricerche indipendenti confermano lo stesso andamento. Alcuni sistemi di rilevamento possono ottenere risultati eccellenti in condizioni di test specifiche, ma le prestazioni possono diminuire quando il testo viene modificato o quando il test include diversi tipi di scrittura.
Ecco perché affermazioni come “100% preciso” vanno interpretate con cautela.
Un rilevatore può ottenere un punteggio di 100% in un determinato benchmark senza per questo essere preciso al 100% su ogni possibile testo, modello, genere o situazione reale.
Il Studio ZDNet Lo studio che ha ispirato i nostri test ha valutato diversi rilevatori di IA utilizzando cinque campioni: tre generati da ChatGPT e due scritti da esseri umani.
Per il nostro confronto abbiamo utilizzato lo stesso parametro di riferimento di base.
I risultati offrono una panoramica utile delle prestazioni di questi strumenti rispetto agli stessi campioni. Non dovrebbero essere considerati come una classifica universale dell'accuratezza del rilevamento tramite IA.
Come abbiamo testato 10 strumenti di rilevamento dell’IA

Per rendere il confronto il più coerente possibile, abbiamo testato 10 strumenti di rilevamento dell’IA utilizzando gli stessi cinque esempi di testo.
Il benchmark comprendeva:
- Tre esempi generati dall'intelligenza artificiale con ChatGPT.
- Due esempi scritti da persone.
- Lo stesso testo è stato inviato a ciascun rilevatore.
- I risultati sono stati registrati in base alla corretta classificazione del campione da parte di ciascuno strumento.
- Un risultato veniva considerato corretto quando il punteggio del rilevatore raggiungeva la soglia utilizzata nel nostro test.
Per garantire la coerenza con la metodologia originale ispirata a ZDNet, un punteggio di probabilità di intelligenza artificiale superiore a 70% è stato considerato come un caso di intelligenza artificiale.
L'accuratezza è stata calcolata dividendo il numero di campioni classificati correttamente per il numero totale di campioni, pari a cinque.
Ad esempio, un rilevatore che ha classificato correttamente quattro dei cinque campioni ha ottenuto un punteggio di accuratezza pari a 80%.
I test sono stati condotti nell’ambito del confronto originale oggetto del presente articolo. Poiché i rilevatori di IA e i modelli su cui si basano cambiano nel tempo, questi risultati vanno considerati come un test effettuato in un determinato momento piuttosto che come una classifica definitiva.
Ma soprattutto, cinque campioni non sono sufficienti per stabilire un’accuratezza universale. Un benchmark più ampio, che includa un maggior numero di stili di scrittura, lunghezze, modelli di IA, lingue e campioni modificati, fornirebbe una misura più attendibile delle prestazioni nel mondo reale.
Risultati dei test di accuratezza del rilevatore di IA
Ecco una panoramica semplificata dei risultati ottenuti dai 10 rilevatori nel nostro test su cinque campioni.
| Rivelatore AI | Risultati corretti | Accuratezza dei test |
|---|---|---|
| AI non rilevabile | 5/5 | 100% |
| GPTZero | 5/5 | 100% |
| QuillBot | 5/5 | 100% |
| ZeroGPT | 5/5 | 100% |
| Originalità.ai | 5/5 | 100% |
| Monica | 5/5 | 100% |
| Copyleaks | 4/5 | 80% |
| Grammatica | 3/5 | 60% |
| Writer.com | 3/5 | 60% |
| Alberello | 0/5 | 0% |
Questi risultati si riferiscono esclusivamente a questo specifico test condotto su cinque campioni. Non devono essere interpretati nel senso che un rilevatore manterrà lo stesso livello di accuratezza su ogni singolo contenuto.
AI non rilevabile
Risultato del test: 5/5 risposte corrette
Precisione: 100%
Cosa è successo: L'IA "Undetectable" ha classificato correttamente tutti e cinque i campioni del nostro test, compresi sia quelli scritti da esseri umani sia tutti e tre quelli generati dall'IA.
Questo risultato l'ha reso uno dei prodotti più performanti in questo specifico confronto.
La piattaforma utilizza più segnali di rilevamento anziché basarsi su un'unica caratteristica della scrittura. Questo tipo di approccio multisegnale è utile perché nessuna singola caratteristica, come la lunghezza delle frasi o la prevedibilità delle parole, è di per sé sufficiente a stabilire l'autore.
In sintesi: L'IA "Undetectable" ha ottenuto prestazioni costanti su tutti e cinque i campioni del nostro test, ma il risultato riflette questo benchmark piuttosto che un'accuratezza universale del modello 100%.
GPTZero
Risultato del test: 5/5 risposte corrette
Precisione: 100%
Cosa è successo: GPTZero ha classificato correttamente tutti e cinque i campioni in base alla nostra soglia di valutazione.
Ha fornito probabilità di intelligenza artificiale molto elevate per alcuni dei campioni generati, riuscendo al contempo a identificare correttamente i campioni scritti da esseri umani.
I risultati dimostrano che GPTZero è in grado di fornire buoni risultati su campioni chiaramente distinti tra testi scritti da esseri umani e testi generati dall'intelligenza artificiale, sebbene altre ricerche abbiano evidenziato che le prestazioni possono variare a seconda della lunghezza del testo e del tipo di scrittura.
In sintesi: GPTZero ha ottenuto buoni risultati in questo test, ma il suo punteggio va comunque interpretato tenendo conto del tipo e della lunghezza del testo analizzato.
Copyleaks
Risultato del test: 4/5 risposte corrette
Precisione: 80%
Cosa è successo: Copyleaks ha classificato erroneamente il primo campione scritto da un essere umano come 100% generato dall'intelligenza artificiale.
Ha inoltre individuato diverse frasi come potenzialmente correlate all’intelligenza artificiale, sebbene il testo fosse stato scritto da una persona.
I restanti quattro campioni sono stati classificati correttamente.
Ciò ha permesso a Copyleaks di ottenere un’accuratezza complessiva di 80% nel nostro test.
In sintesi: Copyleaks ha dato prova di buone prestazioni nel complesso, ma ha dimostrato come anche un rilevatore molto efficace possa comunque generare un falso positivo quando si tratta di testi scritti a mano.
QuillBot
Risultato del test: 5/5 risposte corrette
Precisione: 100%
Cosa è successo: QuillBot ha identificato correttamente tutti e cinque gli esempi del nostro test.
Lo strumento è noto soprattutto per le sue funzionalità di scrittura e parafrasi, ma anche il suo rilevatore di IA ha ottenuto ottimi risultati rispetto al benchmark.
I suoi risultati dimostrano perché il rilevamento tramite IA dovrebbe essere valutato attraverso test concreti piuttosto che sulla base di ipotesi fondate sulle caratteristiche per cui uno strumento è principalmente noto.
In sintesi: QuillBot ha classificato correttamente tutti i campioni di questo test e si è dimostrato uno dei migliori nel confronto.
ZeroGPT
Risultato del test: 5/5 risposte corrette
Precisione: 100%
Cosa è successo: ZeroGPT ha classificato il primo campione scritto da un essere umano come 0% generato dall'IA e il secondo come 9,44% generato dall'IA.
In base ai nostri criteri di valutazione, entrambi sono stati considerati come scritti da esseri umani.
Ha inoltre identificato correttamente tutti e tre i campioni generati dall'IA come scritti dall'IA.
In sintesi: In questo benchmark basato su cinque testi, ZeroGPT ha prodotto risultati coerenti sia sui campioni generati dall'uomo che su quelli generati dall'IA.
Grammatica
Risultato del test: 3/5 risposte corrette
Precisione: 60%
Cosa è successo: Grammarly ha dato risultati contrastanti.
Ha identificato correttamente due dei tre campioni generati dall'IA, con probabilità IA pari a 92% e 81%. Il terzo campione generato dall'IA ha ricevuto un punteggio IA di 54% e, pertanto, non è stato considerato una classificazione corretta dell'IA in base alla nostra soglia.
Ha inoltre identificato correttamente un campione scritto da un essere umano, mentre ha classificato l’altro come generato dall’intelligenza artificiale.
In sintesi: I risultati di Grammarly sono stati meno costanti rispetto a quelli degli strumenti che hanno ottenuto le migliori prestazioni in questo specifico test.
Originalità.ai
Risultato del test: 5/5 risposte corrette
Precisione: 100%
Cosa è successo: Originality.ai ha identificato correttamente tutti e cinque i campioni e ha restituito punteggi di affidabilità elevati sia per i contenuti generati dall'IA che per quelli creati dall'uomo.
La piattaforma è stata progettata specificamente per la verifica dei contenuti e include il rilevamento tramite intelligenza artificiale, oltre ad altre funzionalità di analisi dei contenuti.
Le sue prestazioni in questo test sono risultate costanti per entrambi i tipi di campioni.
In sintesi: Originality.ai ha classificato correttamente tutti e cinque i campioni del nostro test di riferimento, anche se ciò non garantisce un’accuratezza universale.
Writer.com
Risultato del test: 3/5 risposte corrette
Precisione: 60%
Cosa è successo: Il sistema di rilevamento di Writer.com ha classificato correttamente tre dei cinque esempi, ma ha erroneamente identificato due esempi scritti dall’intelligenza artificiale come scritti da esseri umani.
Ciò significa che il rilevatore ha prodotto dei falsi negativi nel nostro test.
Si tratta di una distinzione importante, poiché un rilevatore può sembrare prudente pur non individuando i contenuti generati dall’intelligenza artificiale.
In sintesi: Writer.com ha ottenuto risultati altalenanti nel nostro test di riferimento, in particolare nell’identificazione di alcuni dei campioni generati dall’intelligenza artificiale.
Monica
Risultato del test: 5/5 risposte corrette
Precisione: 100%
Cosa è successo: Nel nostro test, Monica ha identificato correttamente tutti e cinque i campioni senza commettere alcun errore.
I risultati sono stati coerenti sia nei campioni redatti da esseri umani sia in quelli generati dall'intelligenza artificiale.
In sintesi: Monica ha ottenuto ottimi risultati in questo test di riferimento, classificando correttamente tutti e cinque i campioni.
Rilevatore di intelligenza artificiale
Risultato del test: 0/5 risposte corrette nella valutazione iniziale
Precisione: 0%
Cosa è successo: Nel nostro test, Sapling ha prodotto diverse classificazioni errate, tra cui l’assegnazione a due campioni scritti da esseri umani della classificazione “100% generato dall’IA”.
Il risultato ha messo in luce uno dei principali problemi legati al rilevamento dell'IA: un punteggio molto alto non implica necessariamente che il testo sia stato generato dall'IA.
Anche Sapling stessa ha riconosciuto l'esistenza di limiti relativi ai falsi positivi, in particolare con testi più brevi.
In sintesi: Sapling ha ottenuto risultati deludenti in questo specifico benchmark, dimostrando perché i risultati dei sistemi di rilevamento debbano essere valutati con cautela.
Perché i rilevatori basati sull'intelligenza artificiale generano falsi positivi
Si verifica un falso positivo quando un sistema di rilevamento dell'IA classifica un contenuto scritto da una persona come generato dall'IA.
Ciò può accadere per diversi motivi.
La scrittura umana può essere prevedibile
Le persone non scrivono sempre in modi molto diversi tra loro.
I saggi formali, i documenti tecnici, gli articoli accademici, le e-mail aziendali e i contenuti didattici utilizzano spesso un vocabolario e strutture sintattiche convenzionali.
Un sistema di rilevamento che cerchi modelli linguistici prevedibili potrebbe quindi considerare alcuni testi scritti da esseri umani simili a quelli generati dall'intelligenza artificiale.
Un testo breve fornisce meno informazioni ai rilevatori
Un rilevatore ha bisogno di una quantità sufficiente di testo per analizzare modelli significativi.
I brani brevi forniscono meno indizi. Poche frasi potrebbero non presentare una varietà sufficiente di lessico, sintassi o ritmo frasale per consentire una previsione attendibile.
Questo è uno dei motivi per cui alcuni sistemi di rilevamento avvertono gli utenti di non considerare i punteggi relativi ai testi brevi come definitivi.
Uno stile di scrittura prevedibile può sembrare frutto dell’intelligenza artificiale
Una persona che scrive in modo chiaro e coerente può produrre un testo statisticamente prevedibile.
Ad esempio, una frase come “Lo studio ha esaminato gli effetti dell’intelligenza artificiale sull’istruzione” segue una struttura molto convenzionale.
Non c'è nulla in esso che sia intrinsecamente generato dall'intelligenza artificiale, ma un linguaggio altamente prevedibile può influire sul punteggio assegnato da un rilevatore di IA.
L'editing può creare nuovi modelli
La revisione manuale non sempre rende il testo più facile da classificare.
Quando qualcuno modifica in modo sostanziale un testo generato dall'intelligenza artificiale, il risultato può presentare una combinazione di modelli tipici dell'IA e modelli tipici della scrittura umana. Lo stesso può accadere quando una persona modifica il proprio testo per renderlo più chiaro o coerente.
Ciò rende più difficile classificare il testo finale come generato esclusivamente da esseri umani o esclusivamente dall'intelligenza artificiale.
Perché i rilevatori di IA non individuano i testi generati dall'IA
Si verificano falsi negativi quando i contenuti generati dall'intelligenza artificiale vengono classificati come scritti da esseri umani.
Ciò può accadere quando il testo non corrisponde più agli schemi previsti dal sistema di rilevamento.
La parafrasi può modificare i segnali di rilevamento
La riscrittura di un testo generato dall'intelligenza artificiale può modificare il vocabolario, la struttura delle frasi e l'ordine delle parole.
Anche se il contenuto originale provenisse da un modello di intelligenza artificiale, apportando modifiche sufficienti è possibile rendere più difficile per un sistema di rilevamento riconoscere i modelli statistici originali.
Da alcune ricerche è emerso che alcuni sistemi di rilevamento mostrano prestazioni notevolmente inferiori quando il testo generato dall’intelligenza artificiale è stato parafrasato o modificato.
La revisione umana modifica il risultato originale
Spesso le persone modificano i contenuti generati dall'intelligenza artificiale prima di pubblicarli.
Possono aggiungere esempi personali, eliminare frasi ripetitive, modificare la struttura delle frasi o riscrivere intere sezioni.
La versione finale non è più lo stesso testo generato dal modello, il che può rendere più difficile il rilevamento.
I modelli di IA più recenti producono testi più vari
I modelli di intelligenza artificiale continuano a migliorare la loro capacità di cogliere il contesto e di variare lo stile di scrittura.
Ciò significa che i rilevatori devono continuare ad adattarsi.
Un metodo di rilevamento che ha dato buoni risultati con una generazione di modelli potrebbe non funzionare altrettanto bene con un modello più recente o con un tipo diverso di testo generato.
I contenuti misti, composti da elementi umani e di intelligenza artificiale, sono più difficili da classificare
Molti documenti reali non sono né interamente redatti da esseri umani né interamente generati dall'intelligenza artificiale.
Qualcuno potrebbe scrivere l'introduzione da sé, utilizzare l'intelligenza artificiale per creare una bozza, generare alcuni paragrafi e poi modificare manualmente il tutto.
Il documento finale riporta più autori.
Una singola percentuale non sempre riesce a rappresentare accuratamente tale complessità.
Ci si può fidare del punteggio fornito da un rilevatore di IA?
È possibile utilizzare il punteggio fornito da un rilevatore di IA come indicatore utile, ma non si dovrebbe considerarlo una prova definitiva della paternità dell'opera.
Ad esempio, un risultato che riporta la dicitura “95% generato dall’IA” non significa che vi sia una certezza del 95% che il testo sia stato scritto dall’IA.
La percentuale rappresenta la valutazione del rilevatore basata sul proprio modello e sul proprio sistema di punteggio.
Inoltre, rilevatori diversi possono assegnare punteggi diversi allo stesso brano.
Questo è importante perché il risultato di un rilevatore dipende dai dati di addestramento del sistema, dall’approccio di rilevamento, dalla soglia e dalle ipotesi su come si presenta un testo generato dall’IA.
Studi indipendenti hanno rilevato che anche i sistemi di rilevamento più efficaci possono generare falsi positivi e falsi negativi, e che le prestazioni variano a seconda dei diversi tipi di contenuti, sia quelli generati dall’intelligenza artificiale che quelli redatti dall’uomo.
Quando si tratta di decisioni di grande importanza, un rilevatore basato sull’intelligenza artificiale dovrebbe quindi essere considerato come un elemento di prova tra gli altri, piuttosto che come l’autorità definitiva.
Come utilizzare i rilevatori di IA in modo più affidabile
I rilevatori basati sull'intelligenza artificiale possono rivelarsi più utili se li si considera strumenti di selezione piuttosto che giudici assoluti.
Ecco alcuni consigli pratici per migliorare i tuoi risultati.
Inserisci una quantità sufficiente di testo
Quando possibile, analizza un brano significativo piuttosto che una singola frase o un paragrafo molto breve.
Campioni più lunghi forniscono al rilevatore una maggiore quantità di informazioni linguistiche su cui lavorare.
Confronta più rilevatori
Non basarti su un unico punteggio.
Se diversi strumenti indipendenti identificano lo stesso brano come probabilmente generato dall'intelligenza artificiale, ciò costituisce un segnale più forte rispetto al risultato fornito da un unico strumento di rilevamento.
È vero anche il contrario. Se un rilevatore assegna un punteggio AI elevato mentre diversi altri identificano il testo come scritto da un essere umano, il risultato merita un’analisi più approfondita.
Controlla il contesto originale
Considera da dove proviene il contenuto e come è stato creato.
È stato scritto interamente da una persona? È stata utilizzata l'intelligenza artificiale per la fase di ideazione? Il contenuto è stato generato e poi sottoposto a una revisione approfondita?
Comprendere il processo di scrittura può fornire informazioni che un rilevatore di IA non è in grado di individuare.
Considera il punteggio come un segnale
Un punteggio molto alto o molto basso può essere utile, ma non dovrebbe risolvere automaticamente la questione della paternità dell’opera.
Utilizza il risultato per decidere se sia necessario un ulteriore esame.
Conserva le tracce del processo di scrittura
Nel caso di lavori importanti, bozze, cronologia delle revisioni, appunti e altri documenti possono fornire prove più solide della paternità dell’opera rispetto al solo punteggio ottenuto con un rilevatore di IA.
Ciò risulta particolarmente utile nel campo dell'istruzione, dell'editoria, delle assunzioni e in altre situazioni in cui un'accusa infondata può avere gravi conseguenze.
Spiegazione dei metodi più comuni di rilevamento dell'IA
I rilevatori basati sull'intelligenza artificiale utilizzano diverse combinazioni di analisi statistica, apprendimento automatico e altre tecniche.
Non esiste un unico approccio che funzioni alla perfezione in ogni situazione.
Modellazione statistica del linguaggio
I metodi statistici analizzano la probabilità che determinate parole, espressioni e strutture sintattiche compaiano insieme.
La perplessità e la discontinuità sono due concetti spesso associati a questo approccio.
L'obiettivo è individuare gli schemi che ricorrono con maggiore frequenza nei testi generati dall'intelligenza artificiale rispetto a quelli scritti dall'uomo.
Metadati e watermarking
I metadati possono fornire informazioni sulle modalità di creazione dei contenuti, qualora tali informazioni siano disponibili.
La filigranatura adotta un approccio diverso. Anziché analizzare solo il testo finito, è possibile incorporare una filigrana durante il processo di generazione.
Alcune ricerche hanno dimostrato che la filigranatura testuale può essere implementata su larga scala, come nel caso del sistema SynthID-Text di Google per i contenuti generati da Gemini.
Tuttavia, la filigranatura non è la stessa cosa del normale rilevamento tramite intelligenza artificiale, e la sua efficacia dipende da come viene implementata la filigrana e dal fatto che il testo venga successivamente modificato.
La ricerca ha inoltre dimostrato che alcuni sistemi di filigranatura possono perdere efficacia in seguito a riscritture o altre trasformazioni.
Classificatori di apprendimento automatico
Molti rilevatori di IA moderni utilizzano modelli di apprendimento automatico addestrati su esempi di testi generati dall'uomo e dall'IA.
Il rilevatore apprende gli schemi associati a ciascuna categoria e li applica ai nuovi contenuti.
Questo approccio permette di tenere conto contemporaneamente di numerose caratteristiche linguistiche, risultando così più flessibile rispetto all’utilizzo di un unico parametro di valutazione.
Tuttavia, il rilevatore effettua comunque una classificazione probabilistica. Non ha accesso diretto all’identità dell’autore né a una registrazione definitiva di chi abbia digitato le parole.
Domande frequenti
I rilevatori di intelligenza artificiale sono accurati?
I rilevatori basati sull'intelligenza artificiale possono essere precisi in molte situazioni, ma nessuno di essi dovrebbe essere considerato affidabile al 100% per ogni tipo di testo. I risultati possono variare in base alla lunghezza del testo, allo stile di scrittura, al modello di intelligenza artificiale e al fatto che il contenuto sia stato modificato o parafrasato.
I rilevatori di IA sono in grado di individuare ChatGPT?
Sì. I rilevatori di IA sono in grado di identificare gli schemi tipicamente associati ai testi generati da ChatGPT. Tuttavia, il rilevamento non è garantito, soprattutto quando il contenuto è stato pesantemente modificato, parafrasato o combinato con materiale scritto da esseri umani.
I rilevatori di IA possono generare falsi positivi?
Sì. Si verifica un falso positivo quando un contenuto scritto da una persona viene erroneamente classificato come generato dall'intelligenza artificiale. Uno stile di scrittura prevedibile, i brani brevi e determinati stili formali di scrittura possono aumentare il rischio di classificazioni errate.
Perché i rilevatori di IA segnalano i testi scritti da esseri umani?
I rilevatori di IA analizzano gli schemi che possono comparire sia nella scrittura umana che in quella generata dall'IA. Se la scrittura umana è altamente prevedibile, formale o coerente nella struttura, un rilevatore potrebbe erroneamente associare tali schemi a contenuti generati dall'IA.
I testi generati dall'intelligenza artificiale possono eludere i rilevatori di IA?
I testi generati dall'IA possono talvolta sfuggire al rilevamento, in particolare dopo essere stati parafrasati, modificati da un essere umano o sottoposti ad altre modifiche. L'efficacia del rilevamento varia inoltre a seconda dei modelli di IA e dei singoli sistemi di rilevamento.
Qual è il rilevatore di IA più preciso?
Non esiste un unico strumento di rilevamento che possa essere definito il più accurato in ogni situazione. Nel nostro test su cinque campioni, Undetectable AI, GPTZero, QuillBot, ZeroGPT, Originality.ai e Monica hanno classificato correttamente tutti e cinque i campioni. Per stabilire un livello di accuratezza più ampio sarebbero necessari test su un campione più ampio e diversificato.
Ci si può fidare del punteggio assegnato da un rilevatore di IA?
Considerate il punteggio fornito da un rilevatore di IA come un indicatore piuttosto che come una prova definitiva della paternità da parte dell'IA. Per decisioni importanti, confrontate più strumenti e tenete conto della cronologia di scrittura, delle bozze, dei registri di modifica e di altre prove disponibili.
Conclusione
Ma i rilevatori basati sull’intelligenza artificiale sono affidabili? Possono rivelarsi utili, e il nostro test su cinque campioni ha dimostrato che diversi rilevatori hanno dato ottimi risultati nelle stesse condizioni di prova.
Tuttavia, un risultato eccellente nei test di riferimento non significa che un rilevatore garantisca una precisione del 100% su ogni testo.
I falsi positivi, i falsi negativi, i campioni brevi, la parafrasi, la revisione umana, la paternità mista e i modelli di IA più recenti possono tutti influire sui risultati del rilevamento.
L'approccio più affidabile consiste nel considerare un rilevatore di IA come uno strumento di screening. È opportuno utilizzare campioni più lunghi, confrontare i risultati ottenuti da diversi rilevatori e tenere conto del contesto più ampio in cui è stato scritto il testo prima di prendere una decisione in merito alla paternità dell'opera.
Se vuoi confrontare i risultati del rilevamento tramite IA relativi ai tuoi contenuti, prova il Controllore AI da AI non rilevabile nell’ambito del vostro processo di revisione.