Índice de precisión de GPTZero: nuestros resultados de las pruebas de 2026

GPTZero afirma ser el detector de IA más preciso del mundo. Además, realiza pruebas comparativas para respaldar su afirmación.

Sin embargo, vemos cómo hay gente en Reddit y en otros sitios que se queja de que GPTZero marca erróneamente sus textos constantemente.

Entonces, ¿qué parte dice la verdad? La mejor manera de averiguarlo es probar la herramienta, que es lo que hice.

Me llamo Christian Perry y dirijo Undetectable AI. Gracias a mi trabajo, conozco bien cómo funcionan los detectores de IA con distintos tipos de contenido y en qué momentos la mayoría de ellos empiezan a ofrecer resultados inexactos.

Aproveché mis conocimientos y mi experiencia para crear una pequeña prueba para GPTZero. La prueba comprobaría tres aspectos de GPTZero:

  • Precisión de GPTZero en texto sin procesar generado por IA
  • Precisión de GPTZero en textos generados por IA y humanizados mediante una herramienta de IA
  • Precisión de GPTZero en textos claramente escritos por personas

En este artículo te mostraré cuáles han sido mis conclusiones. También aprenderás a interpretar sus resultados de forma responsable para que no acabes utilizando la herramienta para fines para los que no ha sido diseñada.


Principales conclusiones

  • Cuando pasé 8 muestras por GPTZero en esta ronda, detectó todas ellas correctamente, incluyendo el texto original generado por IA, las versiones «humanizadas» y los dos artículos escritos por personas que se publicaron antes de que aparecieran las herramientas de redacción basadas en IA.

  • GPTZero anuncia una tasa de precisión del 99,76% según sus propias pruebas comparativas, pero yo me tomaría con cautela las cifras facilitadas por cualquier empresa y me basaría en pruebas independientes como las mías antes de creerme todo lo que se dice.

  • GPTZero detecta correctamente los textos claramente diferenciados (escritos exclusivamente por personas o exclusivamente por IA), pero le cuesta con los textos que combinan texto humano y de IA.

  • Por muy fiable que parezca su precisión, GPTZero te ofrece una probabilidad y no un veredicto, por lo que nunca debes acusar a un alumno ni a ti mismo basándote únicamente en su puntuación, sobre todo porque los detectores de IA suelen señalar injustamente a los escritores cuyo inglés no es su lengua materna con más frecuencia de lo que la mayoría de la gente cree.


Cómo funciona GPTZero

GPTZero funciona de manera similar a la mayoría de los demás detectores de IA más importantes. Analiza dos señales estadísticas principales de un texto:

  • Perplejidad: Se refiere al grado de previsibilidad de cada palabra en función de las palabras que la rodean. Los textos generados por IA suelen presentar una baja perplejidad debido a su alta previsibilidad. Los seres humanos tienden a ser más aleatorios a la hora de elegir palabras, lo que les confiere una alta perplejidad. 
  • Estallido: Esta señal mide en qué medida varían la longitud y la complejidad de las frases a lo largo de un pasaje. Una vez más, el texto escrito por humanos presenta un alto nivel de «burstiness», ya que escribimos en ráfagas aleatorias. El texto generado por IA presenta un bajo nivel de «burstiness», ya que utiliza una escritura basada en fórmulas.

Estas son solo dos de las muchas señales importantes que utiliza GPTZero. Cuentan con publicó un artículo técnico explicando su arquitectura en detalle, incluyendo cómo procesan el texto parafraseado y los documentos que combinan contenido humano y de IA.

Ese es, pues, el mecanismo básico de GPTZero. Ahora vamos a analizar y comprobar con qué precisión funciona todo esto en la práctica.

Detección de IA Detección de IA

No vuelvas a preocuparte de que la IA detecte tus textos. Undetectable AI puede ayudarle:

  • Haz que aparezca tu escritura asistida por IA de aspecto humano.
  • Bypass las principales herramientas de detección de IA con un solo clic.
  • Utilice AI de forma segura y con confianza en la escuela y el trabajo.
Pruébalo GRATIS

Precisión declarada por GPTZero frente a conclusiones independientes

En cuanto a la precisión, GPTZero afirma ser el detector de IA más preciso que existe. 

En su propio punto de referencia En cuatro ámbitos, afirman haber alcanzado una precisión del 99,761 TP6T, con una tasa de falsos positivos del 0,081 TP6T y un recuerdo del 99,601 TP6T. Sin duda, estas cifras son impresionantes. Pero provienen de la propia herramienta. 

Las pruebas independientes arrojan resultados más o menos similares, con una ligera diferencia.

Me refiero a mi último... Comparación de cinco detectores de IA, entre los que también se encontraba GPTZero.

En esa comparación, analicé 18 muestras de texto (6 de IA sin procesar, 6 de IA humanizada, 4 humanas y 2 mixtas, de IA y humano) con GPTZero, y la herramienta obtuvo una precisión de 100% en casi todas las muestras, a excepción de las mixtas.

Dos muestras mixtas eran 60% humano y 40% IA, y GPTZero determinó que ambas muestras eran de origen humano. Técnicamente, se trataba de un veredicto correcto según el principio de la mayoría.

Pero el problema es que GPTZero detectó 0% AI en la primera muestra mixta y solo 14% AI en la otra muestra mixta. En realidad, los dos textos eran 38% AI y 36% AI, respectivamente.

Esto significa que la precisión de GPTZero es limitada cuando se trata de textos que son una mezcla de trabajo humano y de inteligencia artificial.

Nuestra prueba: ¿Es capaz GPTZero de detectar textos generados por IA? ¿Y marca erróneamente textos escritos por personas?

Quería hacer una pequeña continuación de mi artículo anterior, esta vez centrada específicamente en GPTZero.

Desde mis últimas pruebas, tanto los chatbots de IA como GPTZero han actualizado sus modelos, por lo que mi objetivo con esta prueba es comprobar si GPTZero ha mantenido su precisión.

Para esta prueba de seguimiento, trabajé con 8 muestras de texto.

  • El primer grupo de muestras estaba formado por textos generados por IA. Generé dos muestras de texto con Claude Opus 4.8 y otras dos con GPT 5.5 de ChatGPT. A continuación, seleccioné una muestra de cada uno de estos dos conjuntos y generé dos muestras «humanizadas» mediante la herramienta «humanizer» de Undetectable AI.
Captura de pantalla de dos muestras humanizadas mediante el humanizador de Undetectable AI
  • El segundo grupo de muestras correspondía a escritura humana. Elegí una Artículo de la BBC de 2020 y uno artículo de investigación publicado en 2021. Ambos se publicaron mucho antes del auge de la IA, por lo que es imposible que ninguno de los dos haya sido generado por IA. Así pues, si GPTZero los califica como «IA», se trataría claramente de un falso positivo.

A continuación, analicé todas las muestras con GPTZero.

A continuación se muestra el rendimiento de GPTZero en cada muestra:

MuestraDatos realesVeredicto de GPTZero
Claude, ejemplo 1IA en bruto100% AI
Claude, ejemplo 2IA en bruto100% AI
Ejemplo 1 de ChatGPTIA en bruto100% AI
Ejemplo 2 de ChatGPTIA en bruto100% AI
Muestra 1 de Claude humanizadoIA humanizada92% IA, 8% Mixto
Ejemplo 1 de ChatGPT humanizadoIA humanizada100% AI
Artículo de la BBC (2020)Humano100% Humano
Artículo de investigación (2021)Humano100% Humano

Como puedes ver, el veredicto y la precisión de GPTZero son perfectos en todas las muestras, salvo en una muestra humanizada. 

Esa muestra humanizada de Claude obtuvo una puntuación de IA de 92% y una puntuación mixta de 8%. Una vez más, el veredicto es correcto, solo que la precisión es ligeramente inexacta. 

Aun así, el «humanizador» de Undetectable AI logró mejorar ligeramente el resultado. Pero no lo suficiente como para pasar desapercibido ante GPTZero. La puntuación de IA podría haber sido incluso más baja si hubiera utilizado el «humanizador» premium de Undetectable AI.

Captura de pantalla del veredicto y la precisión de GPTZero

El problema de los falsos positivos en la escritura humana

GPTZero no generó ningún falso positivo en esta prueba con ninguna de las muestras. Pero eso no significa que los falsos positivos no sean un motivo de preocupación en el caso de los detectores de IA en general.

La razón por la que se plantea este problema con los detectores de IA es sencilla. Para estos detectores, un texto con baja perplejidad y baja variabilidad es, muy probablemente, generado por IA.

Sin embargo, estos dos patrones también pueden aparecer en textos escritos por personas reales, sobre todo en contextos formales en los que los autores deben seguir unas pautas estrictas.

Por eso también es habitual que los ensayos bien redactados de personas cuyo inglés no es su lengua materna sean identificados como generados por IA, a pesar de haber sido escritos por humanos. Esto ocurre porque los autores no nativos suelen utilizar estructuras sintácticas más conservadoras y tienen un vocabulario más limitado. 

En mi última prueba comparativa con 18 muestras, los cinco detectores (incluido GPTZero) arrojaron una puntuación de IA de 8% o inferior en todos los fragmentos escritos por humanos, tanto en inglés nativo como en inglés como segunda lengua. Así pues, en esa ronda no se produjo ningún falso positivo.

Pero los ejemplos de inglés como segunda lengua (ESL) que utilicé correspondían a escritores publicados que se expresaban con claridad. Un estudiante de bachillerato que redacte un ensayo universitario en su segunda lengua puede suponer un reto mucho mayor para los detectores de IA.

Cómo interpretar de forma responsable los resultados de GPTZero

Al fin y al cabo, GPTZero es una herramienta basada en la probabilidad. Por lo tanto, su puntuación no debe tomarse como un veredicto definitivo. 

Así es como deberías interpretar las puntuaciones:

  • No interpretes el veredicto como una sentencia condenatoria. Si, por ejemplo, obtienes una puntuación de 87% AI, eso significa que las características estadísticas del texto coinciden en gran medida con los patrones que el detector ha sido entrenado para señalar como IA. Pero eso sigue siendo una predicción, no una prueba. El autor podría seguir siendo humano, sobre todo si la puntuación se sitúa en el rango medio (entre 40% y 70%, a grandes rasgos).
  • Nunca acuses a nadie (ni a ti mismo) basándote únicamente en el veredicto de un solo detector de IA. Analiza el texto con otros principales detectores de IA. Si todos o la mayoría coinciden en que el texto es obra de la IA, es posible que todo el texto o parte de él lo sea realmente. En ese caso, deberías intentar «humanizar» el texto, ya sea por tu cuenta o utilizando un un humanizador como Undetectable AI.
  • Ten en cuenta los falsos positivos, sobre todo en el caso de los autores cuyo inglés no es su lengua materna. Si eres profesor y el texto de un alumno ha sido marcado como generado por IA, deberías plantearte si eso podría deberse a que el alumno está aprendiendo inglés como segunda lengua y simplemente sigue un estilo de redacción rígido.
  • Pregunta al alumno sobre su proceso de redacción. Puedes pedirle que te enseñe sus borradores anteriores o sus apuntes. Si es capaz de hablar sobre su trabajo y explicar los conceptos, el texto puede ser original.

Preguntas frecuentes

¿Cuál es la precisión de GPTZero?

GPTZero, según su propia evaluación comparativa publicada, presenta una precisión de 99,76% con una tasa de falsos positivos de 0,08%. En mi última ronda de pruebas y en la actual, GPTZero mantiene altos índices de precisión. Sin embargo, en ocasiones puede detectar erróneamente textos escritos por humanos como si fueran generados por IA. Además, suele tener dificultades principalmente con las muestras mixtas.

¿GPTZero da falsos positivos?

GPTZero puede dar falsos positivos, ya que ningún detector de IA tiene una precisión del 100% y no debe considerarse como tal. Los detectores de IA como GPTZero pueden cometer errores, especialmente cuando se trata de textos escritos por personas.

Muchos usuarios de Reddit han publicado que GPTZero ha marcado erróneamente sus textos como generados por IA.

¿GPTZero detectará que mi redacción la ha escrito una persona?

Sí, sobre todo si tu texto es formal o sigue un esquema predeterminado. Por eso, un único resultado de GPTZero nunca debe considerarse una prueba del uso de la IA.

¿Deberían las escuelas basarse únicamente en GPTZero?

No. Ningún centro educativo debería basarse en un único detector de IA para tomar decisiones sobre la integridad académica. El riesgo de un falso positivo es pequeño, pero no nulo, y las consecuencias de acusar erróneamente a un alumno son graves. Si los centros educativos utilizan GPTZero, deberían hacerlo como una señal más entre otras muchas.

Reflexiones finales

La precisión de GPTZero fue alta en esta prueba, igual que la última vez que lo probé.

Sin embargo, esta prueba incluía ocho ejemplos de texto básicos. Si hubiera incluido ejemplos de aulas o entornos de trabajo reales, habríamos podido observar que GPTZero generaba falsos positivos.

Hablando de detectores de IA precisos y de la necesidad de obtener el veredicto de varios detectores de IA antes de formarse una opinión, puedes analizar tu contenido con Undetectable AI Detector para obtener una segunda opinión gratuita.

Pide una segunda opinión sobre tu contenido con Undetectable AI’s Detector de IA y comprueba cómo funciona tu texto.