O GPTZero afirma ser o detector de IA mais preciso do mundo. Além disso, realiza testes comparativos para comprovar essa afirmação.
No entanto, vemos pessoas no Reddit e em outros lugares reclamando que o GPTZero marca erroneamente seus textos o tempo todo.
Então, qual das partes está dizendo a verdade? A melhor maneira de descobrir isso é testar a ferramenta, e foi exatamente o que eu fiz.
Meu nome é Christian Perry e sou o responsável pela Undetectable AI. Graças à minha área de atuação, tenho um bom entendimento de como os detectores de IA funcionam em diferentes tipos de conteúdo e em que momentos a maioria deles começa a apresentar resultados imprecisos.
Utilizei meu conhecimento e minha experiência para criar um pequeno teste para o GPTZero. O teste verificaria três aspectos do GPTZero:
- Precisão do GPTZero em textos brutos gerados por IA
- Precisão do GPTZero em textos gerados por IA e humanizados por meio de uma ferramenta de IA
- Precisão do GPTZero em textos claramente escritos por humanos
Este artigo vai mostrar quais foram as minhas conclusões. Você também aprenderá a interpretar os resultados de forma responsável, para não acabar usando a ferramenta de maneiras para as quais ela não foi projetada.
Principais conclusões
- Quando analisei oito amostras no GPTZero nesta rodada, ele detectou todas corretamente, incluindo o texto bruto gerado por IA, as versões humanizadas e os dois artigos escritos por humanos que foram publicados antes do surgimento das ferramentas de redação por IA.
- O GPTZero divulga uma taxa de precisão de 99,76% com base em seus próprios testes comparativos, mas eu recomendaria tratar com cautela os números divulgados pelas próprias empresas e basear-se em testes independentes, como os meus, antes de acreditar no que se diz por aí.
- O GPTZero detecta corretamente textos bem definidos (puramente humanos ou puramente gerados por IA), mas apresenta dificuldades com textos que misturam texto humano e gerado por IA.
- Por mais confiável que sua precisão pareça, o GPTZero fornece uma probabilidade e não um veredicto; portanto, você nunca deve acusar um aluno — ou a si mesmo — com base apenas na pontuação, especialmente porque escritores cujo inglês não é a língua materna costumam ser sinalizados injustamente com mais frequência pelos detectores de IA do que a maioria das pessoas imagina.
Como o GPTZero funciona
O GPTZero funciona de maneira semelhante à maioria dos outros principais detectores de IA. Ele analisa dois sinais estatísticos principais em um texto:
- Perplexidade: Refere-se ao grau de previsibilidade de cada palavra com base nas palavras ao seu redor. Textos gerados por IA tendem a apresentar baixa perplexidade devido à alta previsibilidade. Os seres humanos tendem a ser mais aleatórios na escolha de palavras, o que lhes confere uma alta perplexidade.
- Estourado: Esse indicador mede o grau de variação no comprimento e na complexidade das frases ao longo de uma passagem. Mais uma vez, o texto escrito por humanos apresenta alta variabilidade, pois escrevemos em rajadas aleatórias. O texto gerado por IA apresenta baixa variabilidade, pois utiliza uma redação baseada em fórmulas.
Esses são apenas dois dos muitos sinais importantes que o GPTZero utiliza. Eles têm publicou um artigo técnico explicando sua arquitetura em detalhes, incluindo como processam textos parafraseados e documentos que combinam texto humano e de IA.
Então, esse é o mecanismo básico do GPTZero. Agora, vamos discutir e testar com que precisão tudo isso funciona na prática.
Nunca mais se preocupe com a detecção de seus textos pela IA. Undetectable AI Pode lhe ajudar:
- Faça sua escrita assistida por IA aparecer semelhante ao humano.
- Bypass todas as principais ferramentas de detecção de IA com apenas um clique.
- Uso IA com segurança e com confiança na escola e no trabalho.
Precisão alegada pelo GPTZero versus conclusões independentes
Em termos de precisão, o GPTZero afirma ser o detector de IA mais preciso do mercado.
Em seu próprio parâmetro de referência em quatro domínios, eles relatam ter alcançado uma precisão de 99,761 TP6T, com uma taxa de falsos positivos de 0,081 TP6T e um recall de 99,601 TP6T. Esses números são impressionantes, sem dúvida. Mas eles vêm da própria ferramenta.
Testes independentes mostram um quadro mais ou menos semelhante, com uma ligeira diferença.
Estou falando da minha última comparação entre cinco detectores de IA, que também incluía o GPTZero.
Nessa comparação, submeti 18 amostras de texto (6 geradas por IA sem processamento, 6 geradas por IA humanizada, 4 escritas por humanos e 2 mistas — humanas + IA) ao GPTZero, e o resultado foi uma precisão de 100% em quase todas as amostras, com exceção das amostras mistas.
Duas amostras mistas eram 60% humana e 40% de IA, e o GPTZero classificou ambas as passagens como humanas. Esse foi um veredicto tecnicamente correto, de acordo com o princípio da regra da maioria.
Mas o problema é que o GPTZero detectou 0% AI na primeira amostra mista e apenas 14% AI na outra amostra mista. Na verdade, os dois textos eram, respectivamente, 38% AI e 36% AI.
Isso significa que a precisão do GPTZero é limitada quando se trata de textos que são uma combinação do trabalho humano e da IA.
Nosso teste: o GPTZero consegue identificar textos gerados por IA e sinaliza erroneamente textos escritos por humanos?
Gostaria de fazer uma pequena continuação do meu artigo anterior, desta vez com foco específico no GPTZero.
Desde meus últimos testes, tanto os chatbots de IA quanto o GPTZero atualizaram seus modelos; portanto, meu objetivo com este teste é verificar se o GPTZero manteve sua precisão.
Para este teste de acompanhamento, trabalhei com 8 amostras de texto.
- O primeiro grupo de amostras consistia em textos gerados por IA. Gerei duas amostras de texto usando o Claude Opus 4.8 e duas amostras de texto usando o GPT 5.5 do ChatGPT. Em seguida, selecionei uma amostra de cada um desses dois conjuntos e gerei duas amostras humanizadas por meio do humanizador do Undetectable AI.

- O segundo grupo de amostras consistia em escrita humana. Escolhi uma Artigo da BBC de 2020 e um artigo científico publicado em 2021. Ambos foram publicados bem antes do boom da IA, portanto, não há como um deles ter sido gerado por IA. Portanto, se o GPTZero classificá-los como gerados por IA, isso seria claramente um falso positivo.
Em seguida, verifiquei todas as amostras no GPTZero.
Veja a seguir o desempenho do GPTZero em cada amostra:
| Amostra | Verdade fundamental | Veredicto do GPTZero |
| Claude Exemplo 1 | IA Bruta | 100% AI |
| Claude – Exemplo 2 | IA Bruta | 100% AI |
| Exemplo 1 do ChatGPT | IA Bruta | 100% AI |
| Exemplo 2 do ChatGPT | IA Bruta | 100% AI |
| Amostra 1 do Claude humanizado | IA humanizada | 92% IA, 8% Misto |
| Exemplo 1 do ChatGPT humanizado | IA humanizada | 100% AI |
| Artigo da BBC (2020) | Humanos | 100% Humano |
| Artigo científico (2021) | Humanos | 100% Humano |
É possível observar que o veredicto e a precisão do GPTZero são perfeitos em todas as amostras, exceto em uma amostra humanizada.
Essa amostra humanizada de Claude recebeu uma pontuação de IA de 92% e uma pontuação mista de 8%. Mais uma vez, o veredicto está correto, mas a precisão está um pouco errada.
Mesmo assim, o “humanizador” da Undetectable AI conseguiu melhorar um pouco o resultado. Só que não o suficiente para passar despercebido pelo GPTZero. A pontuação de IA poderia ter sido ainda mais baixa se eu tivesse usado o “humanizador” premium da Undetectable AI.

O problema dos falsos positivos na escrita humana
O GPTZero não apresentou nenhum falso positivo neste teste em nenhuma amostra. Mas isso não significa que os falsos positivos não sejam uma preocupação no que diz respeito aos detectores de IA em geral.
A razão pela qual esse problema ocorre com os detectores de IA é simples. Para esses detectores, um texto com baixa perplexidade e baixa variabilidade é, muito provavelmente, gerado por IA.
Mas esses dois padrões também podem aparecer em textos genuinamente humanos, especialmente em contextos formais, nos quais os autores precisam seguir diretrizes rígidas.
É também por isso que é comum ver redações bem elaboradas de falantes não nativos de inglês serem identificadas como produzidas por IA, apesar de terem sido escritas por seres humanos. Isso acontece porque os escritores não nativos costumam usar estruturas de frases mais seguras e têm um vocabulário mais limitado.
Em meu último teste comparativo com 18 amostras, todos os cinco detectores (incluindo o GPTZero) apresentaram uma pontuação de IA de 8% ou inferior em todas as passagens escritas por humanos, tanto por falantes nativos de inglês quanto por falantes de inglês como segunda língua. Portanto, nessa rodada, não houve nenhum falso positivo.
Mas as amostras de ESL que utilizei eram de escritores publicados e com boa expressão. Um aluno do ensino médio escrevendo uma redação para a faculdade em sua segunda língua pode ser um caso muito mais difícil para os detectores de IA.
Como interpretar um resultado do GPTZero de forma responsável
No fim das contas, o GPTZero é uma ferramenta baseada em probabilidade. Portanto, sua pontuação não deve ser considerada como um veredicto definitivo.
Veja, em vez disso, como você deve lidar com as notas:
- Não interprete o resultado como um veredicto de culpa. Se, por exemplo, você obtiver uma pontuação de 87% no detector de IA, isso significa que as características estatísticas do texto se sobrepõem fortemente aos padrões para os quais o detector foi treinado a sinalizar como IA. Mas isso ainda é uma previsão, não uma prova. O autor ainda pode ser humano, especialmente se a pontuação se situar na faixa intermediária (entre 40% e 70%, em termos gerais).
- Nunca acuse ninguém (nem a si mesmo) com base apenas no veredicto de um único detector de IA. Analise o texto com outros principais detectores de IA. Se todos ou a maioria concordarem que o texto foi gerado por IA, é possível que o texto inteiro ou parte dele tenha sido, de fato, gerado por IA. Nesse caso, você deve tentar humanizar o texto, seja por conta própria ou utilizando um humanizador como o Undetectable AI.
- Leve em conta os falsos positivos, especialmente no caso de autores cujo inglês não é a língua materna. Se você é professor e o texto de um aluno foi sinalizado como sendo de IA, deve considerar se isso pode estar ocorrendo porque o aluno é um aluno de inglês como segunda língua (ESL) e simplesmente segue um estilo de redação rígido.
- Pergunte ao aluno sobre seu processo de elaboração. Você pode pedir que ele mostre seus rascunhos anteriores ou anotações. Se ele conseguir falar sobre seu trabalho e explicar os conceitos, o texto pode ser original.
Perguntas frequentes
Qual é a precisão do GPTZero?
O GPTZero, em seu próprio teste de desempenho publicado, apresenta uma precisão de 99,76% com uma taxa de falsos positivos de 0,08%. Na minha última rodada de testes e na atual, o GPTZero mantém altas taxas de precisão. Porém, às vezes, ele pode detectar erroneamente textos escritos por humanos como sendo de IA. Além disso, ele apresenta dificuldades principalmente com amostras mistas.
O GPTZero apresenta falsos positivos?
O GPTZero pode gerar falsos positivos, já que nenhum detector de IA tem 100% de precisão e não deve ser tratado como tal. Detectores de IA como o GPTZero podem cometer erros, especialmente quando se trata de textos escritos por humanos.
Muitos usuários do Reddit publicaram posts dizendo que seus textos foram erroneamente sinalizados como gerados por IA pelo GPTZero.
O GPTZero vai identificar minha redação escrita por uma pessoa?
Isso pode acontecer, especialmente se o seu texto for formal ou seguir um padrão fixo. É por isso que um único resultado do GPTZero nunca deve ser considerado prova do uso de IA.
As escolas deveriam contar apenas com o GPTZero?
Não. Nenhuma instituição de ensino deveria basear-se em um único detector de IA para tomar decisões sobre integridade acadêmica. O risco de um falso positivo é pequeno, mas não é zero, e as consequências de acusar injustamente um aluno são graves. Se as instituições estiverem utilizando o GPTZero, devem fazê-lo como um dos vários indicadores disponíveis
Considerações finais
A precisão do GPTZero foi alta neste teste, assim como da última vez que o testei.
Mas esse teste incluiu oito amostras de texto básicas. Se eu tivesse incluído amostras de salas de aula ou ambientes de trabalho reais, poderíamos ter observado o GPTZero gerando falsos positivos.
Por falar em detectores de IA precisos e na necessidade de obter o veredicto de vários detectores de IA antes de formar uma opinião, você pode analisar seu conteúdo usando o Undetectable AI Detector para obter uma segunda opinião gratuita.
Obtenha uma segunda opinião sobre o seu conteúdo com a Undetectable AI Detector de IA e veja como o seu texto se sai.