Los detectores de IA pueden resultar útiles para identificar patrones que suelen aparecer en los textos generados por IA, pero ningún detector tiene una precisión del 100% en todas las situaciones.
Entonces, ¿son precisos los detectores de IA? La respuesta depende de la herramienta, del tipo y la extensión del texto que se analice, del modelo de IA utilizado para generarlo y de si el contenido ha sido editado o parafraseado.
Los modelos modernos de IA pueden generar textos que se asemejan mucho a los escritos por personas, mientras que los textos escritos por personas pueden parecer a veces tan predecibles que activan un detector de IA. Esto da lugar a dos problemas habituales: los falsos positivos, en los que un texto escrito por una persona se marca como generado por IA, y los falsos negativos, en los que un texto generado por IA se clasifica como escrito por una persona.
Para comprobar el rendimiento de las distintas herramientas, hemos probado diez detectores de IA muy utilizados con el mismo conjunto de referencia compuesto por cinco textos. El objetivo no era demostrar que algún detector fuera universalmente preciso, sino comparar la consistencia de su rendimiento en las mismas condiciones.
Esto es lo que hemos descubierto.
Principales conclusiones
- Los detectores de IA buscan patrones como la previsibilidad de las palabras, la variación en las oraciones, la sintaxis y otras características asociadas al texto generado por IA.
- Ningún detector de IA es totalmente fiable. Pueden darse falsos positivos y falsos negativos, sobre todo en textos breves, editados o muy predecibles.
- Nuestra prueba con cinco muestras reveló diferencias importantes entre los detectores: algunas herramientas clasificaron correctamente las cinco muestras, mientras que otras no detectaron una o más.
- La puntuación de un detector debe considerarse un indicador, no una prueba definitiva de quién es el autor de un contenido.
- Para obtener mejores resultados, analiza muestras más largas, compara los resultados de varias herramientas y ten en cuenta cómo se ha creado y editado el contenido.
¿Qué son los detectores de IA y cómo funcionan?
Los detectores de IA son herramientas diseñadas para determinar si un texto ha sido escrito por un ser humano o generado por inteligencia artificial.
En lugar de identificar una etiqueta oculta que diga “generado por IA”, la mayoría de los detectores analizan las características del texto. Entre ellas pueden figurar la elección de palabras, la estructura de las oraciones, la previsibilidad, la sintaxis y los patrones aprendidos a partir de amplias colecciones de textos generados tanto por humanos como por IA.
Escritura generada por IA pueden presentar patrones estadísticos que difieren de la escritura humana habitual. Dado que los modelos de lenguaje generan texto prediciendo secuencias probables de palabras, el resultado que ofrecen puede parecer a veces más predecible o coherente que el contenido escrito de forma natural.
No vuelvas a preocuparte de que la IA detecte tus textos. Undetectable AI puede ayudarle:
- Haz que aparezca tu escritura asistida por IA de aspecto humano.
- Bypass las principales herramientas de detección de IA con un solo clic.
- Utilice AI de forma segura y con confianza en la escuela y el trabajo.
Dos conceptos que suelen asociarse a la detección de IA son la perplejidad y la irregularidad.
Perplejidad
La perplejidad mide el grado de previsibilidad de una secuencia de palabras para un modelo lingüístico.
Por lo general, una puntuación de perplejidad más baja indica que el texto es más fácil de predecir. El texto generado por IA puede presentar en ocasiones una perplejidad más baja, ya que los modelos de lenguaje tienden a seleccionar secuencias de palabras estadísticamente probables.
Los escritores humanos son menos coherentes. Pueden utilizar expresiones poco habituales, elecciones léxicas inesperadas, formulaciones personales o estructuras sintácticas más difíciles de predecir.
Sin embargo, la perplejidad por sí sola no basta para demostrar de forma fiable la autoría. La escritura humana también puede ser muy predecible, sobre todo cuando el tema es técnico, formal o repetitivo.
Ráfagas
La «burstiness» describe la variación en la longitud, la estructura y el ritmo de las frases.
La escritura humana suele contener una mezcla de frases cortas y largas. El texto generado por IA puede parecer a veces más uniforme, con estructuras de frase y un ritmo similares a lo largo de todo el texto.
Sin embargo, los modelos de lenguaje modernos han mejorado mucho a la hora de variar sus resultados. Esto hace que la irregularidad sea menos útil como señal por sí sola y es una de las razones por las que la detección actual de IA suele basarse en múltiples señales en lugar de en una simple medición.
Por qué es tan difícil detectar la IA
La idea básica que subyace a la detección de la IA parece sencilla: identificar los patrones que distinguen la escritura humana de la generada por una máquina.
En la práctica, esa línea divisoria es mucho menos clara.
La escritura humana y la generada por IA utilizan el mismo lenguaje. Los modelos de IA se entrenan con material creado por personas, por lo que aprenden muchas de las mismas estructuras gramaticales, patrones de vocabulario y convenciones de escritura que utilizan las personas.
Esto plantea varios retos para los sistemas de detección.
La escritura humana y la generada por IA pueden parecer similares
Los modelos de IA están diseñados para generar lenguaje natural. A medida que los modelos mejoran, su escritura puede volverse menos repetitiva y más sensible al contexto.
Al mismo tiempo, es habitual que la gente escriba de forma predecible. La redacción académica, la comunicación empresarial, las descripciones de productos y la documentación técnica pueden seguir estructuras establecidas que un detector de IA podría interpretar como generadas por una máquina.
Esto significa que un detector no se limita a preguntarse: “¿Esto suena a IA?”.”
Lo que hace es evaluar si las características estadísticas y lingüísticas del texto concuerdan en mayor medida con los patrones que asocia al contenido generado por IA.
Falsos positivos y falsos negativos
Se produce un falso positivo cuando un texto escrito por una persona se clasifica erróneamente como generado por IA.
Un falso negativo es lo contrario. El texto generado por IA se clasifica como escrito por un ser humano.
Ambas cosas son importantes.
Un falso positivo puede causar problemas cuando se acusa a alguien de utilizar IA a pesar de que haya escrito el contenido por sí mismo. Un falso negativo puede hacer que el material generado por IA pase por un sistema de detección sin que se señale.
Las investigaciones también han revelado que el rendimiento de los detectores puede variar considerablemente en función del tipo de texto, del modelo utilizado y de si el contenido ha sido modificado.
Los modelos de IA no dejan de cambiar
La detección de la IA es un objetivo en constante evolución, ya que los sistemas que generan el texto cambian continuamente.
Los modelos de IA más antiguos solían generar patrones más evidentes, como frases repetitivas y estructuras predecibles. Los modelos más recientes pueden generar textos más variados y ajustarse mejor al contexto.
Eso no significa que sea imposible detectar el contenido moderno generado por IA. Significa que los desarrolladores de detectores tienen que actualizar continuamente sus sistemas para tener en cuenta los nuevos modelos y los nuevos patrones de redacción.
¿Cuál es la precisión actual de los detectores de IA?
No existe una cifra única de precisión que se aplique a todos los detectores de IA.
Es posible que una herramienta funcione muy bien con textos generados por IA sin modificar, pero que tenga dificultades con contenidos parafraseados o editados por personas. Otro detector podría ser más conservador y generar menos falsos positivos, pero pasar por alto algunos pasajes generados por IA.
Los estudios independientes muestran la misma tendencia. Algunos detectores pueden ofrecer buenos resultados en condiciones de prueba específicas, pero su rendimiento puede disminuir cuando se modifica el texto o cuando la prueba incluye diferentes tipos de escritura.
Por eso hay que interpretar con cautela afirmaciones como “precisión 100%”.
Un detector puede obtener una puntuación de 100% en una prueba de rendimiento concreta sin que por ello tenga una precisión de 100% en todos los textos, modelos, géneros o situaciones del mundo real posibles.
En Estudio de ZDNet El estudio que nos sirvió de inspiración evaluó varios detectores de IA utilizando cinco muestras: tres generadas por ChatGPT y dos escritas por personas.
Para nuestra comparación, hemos utilizado el mismo punto de referencia básico.
Los resultados ofrecen una visión general útil del rendimiento de estas herramientas con las mismas muestras. No deben considerarse como una clasificación universal de la precisión de la detección mediante IA.
Cómo hemos probado 10 detectores de IA

Para que la comparación fuera lo más coherente posible, probamos 10 detectores de IA utilizando las mismas cinco muestras de texto.
El índice de referencia incluía:
- Tres ejemplos generados por IA con ChatGPT.
- Dos ejemplos escritos por personas.
- Se envió el mismo texto a cada detector.
- Los resultados se registraron en función de si cada herramienta clasificaba correctamente la muestra.
- Un resultado se consideraba una clasificación correcta cuando la puntuación del detector alcanzaba el umbral utilizado en nuestra prueba.
Para mantener la coherencia con la metodología original inspirada en ZDNet, una puntuación de probabilidad de IA superior a 70% se consideró una clasificación de IA.
La precisión se calculó dividiendo el número de muestras clasificadas correctamente entre el total de cinco muestras.
Por ejemplo, un detector que clasificó correctamente cuatro de las cinco muestras obtuvo una puntuación de precisión de 80%.
Las pruebas se llevaron a cabo como parte de la comparación original de este artículo. Dado que los detectores de IA y los modelos en los que se basan cambian con el tiempo, estos resultados deben interpretarse como una prueba realizada en un momento concreto y no como una clasificación definitiva.
Y lo que es más importante, cinco muestras no son suficientes para determinar la precisión general. Una prueba comparativa más amplia, que incluyera más estilos de redacción, longitudes, modelos de IA, idiomas y muestras editadas, proporcionaría una medida más sólida del rendimiento en el mundo real.
Resultados de las pruebas de precisión del detector de IA
A continuación se ofrece un resumen simplificado del rendimiento de los 10 detectores en nuestra prueba con cinco muestras.
| Detector de IA | Resultados correctos | Precisión de las pruebas |
|---|---|---|
| IA indetectable | 5/5 | 100% |
| GPTZero | 5/5 | 100% |
| QuillBot | 5/5 | 100% |
| ZeroGPT | 5/5 | 100% |
| Originalidad.ai | 5/5 | 100% |
| Mónica | 5/5 | 100% |
| Copyleaks | 4/5 | 80% |
| Grammarly | 3/5 | 60% |
| Escritor.com | 3/5 | 60% |
| Arbolito | 0/5 | 0% |
Estas puntuaciones se refieren únicamente a esta prueba concreta realizada con cinco muestras. No deben interpretarse en el sentido de que un detector mantendrá la misma precisión en todos los contenidos.
IA indetectable
Resultado de la prueba: 5/5 correctas
Precisión: 100%
Qué ocurrió: La IA indetectable clasificó correctamente las cinco muestras de nuestra prueba, incluidas tanto las escritas por personas como las tres generadas por IA.
Este resultado lo convirtió en uno de los que mejor rendimiento obtuvieron en esta comparación concreta.
La plataforma utiliza múltiples señales de detección en lugar de basarse en una sola característica de la escritura. Este tipo de enfoque multisinal es útil porque ninguna característica por sí sola, como la longitud de las frases o la previsibilidad de las palabras, basta para determinar la autoría.
Conclusión: La IA «indetectable» obtuvo resultados homogéneos en las cinco muestras de nuestra prueba, pero el resultado refleja este punto de referencia y no una precisión universal de 100%.
GPTZero
Resultado de la prueba: 5/5 correctas
Precisión: 100%
Qué ocurrió: GPTZero clasificó correctamente las cinco muestras según nuestro umbral de prueba.
Ofreció probabilidades de IA muy elevadas en algunas de las muestras generadas, al tiempo que identificó correctamente las muestras escritas por personas.
Los resultados muestran que GPTZero ofrece un buen rendimiento con muestras claramente diferenciadas entre texto escrito por personas y texto generado por IA, aunque otros estudios han revelado que el rendimiento puede variar en función de la longitud del texto y del tipo de redacción.
Conclusión: GPTZero obtuvo buenos resultados en esta prueba, pero su puntuación debe interpretarse teniendo en cuenta el tipo y la longitud del texto analizado.
Copyleaks
Resultado de la prueba: 4/5 acertadas
Precisión: 80%
Qué ocurrió: Copyleaks clasificó erróneamente la primera muestra escrita por un ser humano como 100% generada por IA.
Además, identificó varias frases como potencialmente relacionadas con la IA, a pesar de que el texto de la muestra había sido escrito por una persona.
Las cuatro muestras restantes se clasificaron correctamente.
Esto le otorgó a Copyleaks una precisión global de 80% en nuestra prueba.
Conclusión: Copyleaks funcionó bien en general, pero demostró que incluso un detector muy eficaz puede dar falsos positivos con textos escritos por personas.
QuillBot
Resultado de la prueba: 5/5 correctas
Precisión: 100%
Qué ocurrió: QuillBot identificó correctamente las cinco muestras de nuestra prueba.
Esta herramienta es más conocida por sus funciones de redacción y paráfrasis, pero su detector de IA también obtuvo unos resultados excelentes en la prueba comparativa.
Sus resultados demuestran por qué la detección mediante IA debe evaluarse mediante pruebas reales, en lugar de basarse en suposiciones derivadas de las funciones por las que se conoce principalmente a una herramienta.
Conclusión: QuillBot clasificó correctamente todas las muestras de esta prueba y fue uno de los que mejor rendimiento obtuvo en la comparación.
ZeroGPT
Resultado de la prueba: 5/5 correctas
Precisión: 100%
Qué ocurrió: ZeroGPT clasificó la primera muestra escrita por un humano como «0% generada por IA» y la segunda como «9,44% generada por IA».
Según nuestros criterios de prueba, ambos se consideraron escritos por personas.
Además, identificó correctamente las tres muestras generadas por IA como escritas por IA.
Conclusión: ZeroGPT obtuvo resultados consistentes tanto en las muestras generadas por humanos como en las generadas por IA en esta prueba comparativa con cinco textos.
Grammarly
Resultado de la prueba: 3/5 acertadas
Precisión: 60%
Qué ocurrió: Grammarly arrojó resultados dispares.
Identificó correctamente dos de las tres muestras generadas por IA, con probabilidades de IA de 92% y 81%. La tercera muestra generada por IA obtuvo una puntuación de IA de 54% y, por lo tanto, no se contabilizó como una clasificación correcta de IA según nuestro umbral.
Además, identificó correctamente una muestra escrita por una persona, pero clasificó la otra como generada por IA.
Conclusión: Los resultados de Grammarly fueron menos consistentes que los de las herramientas que obtuvieron mejores resultados en esta prueba concreta.
Originalidad.ai
Resultado de la prueba: 5/5 correctas
Precisión: 100%
Qué ocurrió: Originality.ai identificó correctamente las cinco muestras y arrojó puntuaciones de confianza elevadas tanto para el contenido generado por IA como para el humano.
La plataforma está diseñada específicamente para la verificación de contenidos e incluye detección mediante inteligencia artificial, además de otras funciones de análisis de contenidos.
Su rendimiento en esta prueba fue similar en los dos tipos de muestras.
Conclusión: Originality.ai clasificó correctamente las cinco muestras de nuestra prueba comparativa, aunque esto no garantiza una precisión universal.
Escritor.com
Resultado de la prueba: 3/5 acertadas
Precisión: 60%
Qué ocurrió: El detector de Writer.com clasificó correctamente tres de las cinco muestras, pero identificó erróneamente dos muestras escritas por IA como escritas por personas.
Eso significa que el detector dio falsos negativos en nuestra prueba.
Se trata de una distinción importante, ya que un detector puede parecer conservador y, aun así, pasar por alto contenidos generados por IA.
Conclusión: Writer.com obtuvo resultados irregulares en nuestra prueba de rendimiento, sobre todo a la hora de identificar algunas de las muestras generadas por IA.
Mónica
Resultado de la prueba: 5/5 correctas
Precisión: 100%
Qué ocurrió: Mónica identificó correctamente las cinco muestras sin cometer ningún error en nuestra prueba.
Sus resultados fueron coherentes tanto en las muestras redactadas por personas como en las generadas por IA.
Conclusión: Mónica obtuvo unos excelentes resultados en esta prueba comparativa, al clasificar correctamente las cinco muestras.
Sapling AI Detector
Resultado de la prueba: 0/5 acertadas en la evaluación original
Precisión: 0%
Qué ocurrió: Sapling generó varias clasificaciones erróneas en nuestra prueba, entre ellas la de marcar dos muestras escritas por humanos como «100% generadas por IA».
El resultado puso de manifiesto uno de los mayores problemas de la detección de IA: una puntuación de IA muy alta no significa necesariamente que el texto haya sido generado por IA.
La propia Sapling también ha reconocido que existen limitaciones en cuanto a los falsos positivos, sobre todo con textos más cortos.
Conclusión: Sapling obtuvo malos resultados en esta prueba de rendimiento concreta y demostró por qué los resultados de los detectores deben evaluarse con cautela.
Por qué los detectores de IA generan falsos positivos
Se produce un falso positivo cuando un detector de IA clasifica un contenido escrito por personas como generado por IA.
Esto puede suceder por varias razones.
La escritura humana puede ser predecible
La gente no siempre escribe de formas muy diferentes.
Los ensayos formales, los documentos técnicos, los trabajos académicos, los correos electrónicos de negocios y los contenidos didácticos suelen emplear un vocabulario y unas estructuras sintácticas convencionales.
Por lo tanto, un detector que busque patrones lingüísticos predecibles podría considerar que algunos textos escritos por humanos son similares a los generados por la IA.
Un texto breve proporciona menos información a los detectores
Un detector necesita suficiente texto para analizar patrones significativos.
Los pasajes cortos proporcionan menos indicios. Es posible que unas pocas frases no contengan suficiente variedad en cuanto a vocabulario, sintaxis o ritmo de la frase como para realizar una predicción fiable.
Esta es una de las razones por las que algunos sistemas de detección advierten a los usuarios de que no deben considerar definitivas las puntuaciones de textos breves.
La escritura predecible puede parecer obra de la IA
Una persona que escribe con claridad y coherencia puede elaborar textos que sean estadísticamente predecibles.
Por ejemplo, una frase como “El estudio analizó los efectos de la IA en la educación” sigue una estructura muy convencional.
No hay nada en ello que sea intrínsecamente generado por IA, pero un lenguaje muy predecible puede influir en la puntuación de un detector de IA.
La edición puede crear nuevos patrones
La revisión humana no siempre facilita la clasificación del texto.
Cuando alguien revisa en profundidad un texto generado por IA, el resultado puede contener una mezcla de patrones propios de la IA y de los humanos. Lo mismo puede ocurrir cuando una persona edita su propio texto para mejorar su claridad o coherencia.
Esto hace que resulte más difícil clasificar el texto final como algo generado exclusivamente por personas o exclusivamente por IA.
Por qué los detectores de IA no detectan los textos generados por IA
Los falsos negativos se producen cuando el contenido generado por IA se clasifica como escrito por personas.
Esto puede ocurrir cuando el texto ya no se ajusta a los patrones que espera un detector.
La paráfrasis puede modificar las señales de detección
La reescritura de un texto generado por IA puede modificar el vocabulario, la estructura de las oraciones y el orden de las palabras.
Aunque el contenido original proceda de un modelo de IA, si se introducen suficientes cambios, puede resultar más difícil para un detector reconocer los patrones estadísticos originales.
Las investigaciones han revelado que algunos detectores ofrecen un rendimiento considerablemente inferior cuando el texto generado por IA ha sido parafraseado o modificado.
La revisión humana modifica el resultado original
A menudo, la gente revisa el contenido generado por la IA antes de publicarlo.
Pueden añadir ejemplos personales, eliminar frases repetitivas, cambiar la estructura de las oraciones o reescribir secciones enteras.
La versión final ya no es el mismo texto generado por el modelo, lo que puede dificultar su detección.
Los modelos de IA más recientes generan textos más variados
Los modelos de IA siguen mejorando su capacidad para tener en cuenta el contexto y variar su estilo de redacción.
Eso significa que los detectores tienen que seguir adaptándose.
Un método de detección que haya funcionado bien con una generación de modelos puede que no ofrezca el mismo rendimiento con un modelo más reciente o con un tipo diferente de texto generado.
El contenido que combina elementos humanos y de IA es más difícil de clasificar
Muchos documentos del mundo real no son ni totalmente de origen humano ni totalmente generados por la IA.
Es posible que alguien escriba la introducción por su cuenta, utilice la IA para crear un esquema, genere unos cuantos párrafos y, a continuación, lo edite todo manualmente.
El documento final cuenta con varios autores.
Un único porcentaje no siempre puede reflejar esa complejidad con precisión.
¿Se puede confiar en la puntuación de un detector de IA?
Puedes utilizar la puntuación de un detector de IA como un indicador útil, pero no debes considerarla una prueba definitiva de la autoría.
Por ejemplo, un resultado que indique «95% generado por IA» no significa que haya una certeza del 95% de que el texto lo haya escrito la IA.
El porcentaje representa la valoración del detector basada en su propio modelo y sistema de puntuación.
Además, los distintos detectores pueden otorgar puntuaciones diferentes a un mismo fragmento.
Esto es importante porque el resultado de un detector depende de los datos de entrenamiento del sistema, del método de detección, del umbral y de las suposiciones sobre cómo es la escritura generada por IA.
Varios estudios independientes han revelado que incluso los detectores más eficaces pueden generar falsos positivos y falsos negativos, y que su rendimiento varía en función de los distintos tipos de contenido, tanto el generado por IA como el redactado por personas.
Por lo tanto, en el caso de decisiones de gran importancia, un detector de IA debería considerarse una prueba más, y no la autoridad definitiva.
Cómo utilizar los detectores de IA de forma más fiable
Los detectores de IA pueden resultar más útiles si se consideran herramientas de selección en lugar de jueces absolutos.
A continuación te ofrecemos algunas ideas prácticas para mejorar tus resultados.
Escribe lo suficiente
Siempre que sea posible, analiza un fragmento significativo en lugar de una sola frase o un párrafo muy breve.
Las muestras más largas proporcionan al detector más información lingüística con la que trabajar.
Comparar varios detectores
No te fíes de una sola puntuación.
Si varias herramientas independientes identifican el mismo fragmento como probablemente generado por IA, eso te da una indicación más clara que el resultado de un solo detector.
Lo contrario también es cierto. Si un detector arroja una puntuación alta en la prueba de IA, mientras que varios otros identifican el texto como de origen humano, el resultado merece un análisis más detallado.
Consulta el contexto original
Ten en cuenta de dónde procede el contenido y cómo se ha creado.
¿Lo ha escrito todo una persona? ¿Se ha utilizado la inteligencia artificial para generar ideas? ¿Se ha generado el contenido y luego se ha editado en profundidad?
Comprender el proceso de redacción puede aportar información que un detector de IA no es capaz de detectar.
Considera la puntuación como una señal
Una puntuación muy alta o muy baja puede resultar útil, pero no debería zanjar automáticamente la cuestión de la autoría.
Utiliza el resultado para decidir si es necesario realizar un análisis más detallado.
Conserva pruebas del proceso de redacción
En el caso de trabajos importantes, los borradores, el historial de revisiones, las notas y otros registros pueden constituir una prueba más sólida de la autoría que la puntuación de un detector de IA por sí sola.
Esto resulta especialmente útil en el ámbito educativo, editorial, de la contratación y en otras situaciones en las que una acusación infundada puede acarrear graves consecuencias.
Explicación de los métodos habituales de detección de IA
Los detectores de IA utilizan diferentes combinaciones de análisis estadístico, aprendizaje automático y otras técnicas.
No hay ningún método que funcione a la perfección en todas las situaciones.
Modelización estadística del lenguaje
Los métodos estadísticos analizan la probabilidad de que determinadas palabras, expresiones y estructuras sintácticas aparezcan juntas.
La perplejidad y la irregularidad son dos conceptos que suelen asociarse a este enfoque.
El objetivo es identificar patrones que aparezcan con mayor frecuencia en los textos generados por la inteligencia artificial que en los escritos por personas.
Metadatos y marcas de agua
Los metadatos pueden proporcionar información sobre cómo se creó el contenido, siempre que dicha información esté disponible.
La marca de agua adopta un enfoque diferente. En lugar de analizar únicamente el texto final, la marca de agua puede integrarse durante el proceso de generación.
Algunos sistemas de investigación han demostrado que las marcas de agua en texto pueden implementarse a gran escala, incluido el sistema SynthID-Text de Google para contenidos generados por Gemini.
Sin embargo, la marca de agua no es lo mismo que la detección habitual mediante IA, y su eficacia depende de cómo se implemente la marca de agua y de si el texto se modifica posteriormente.
Las investigaciones también han demostrado que algunos sistemas de marcas de agua pueden perder eficacia tras una reescritura u otras transformaciones.
Clasificadores de aprendizaje automático
Muchos detectores modernos de IA utilizan modelos de aprendizaje automático entrenados con ejemplos de textos generados tanto por humanos como por IA.
El detector aprende los patrones asociados a cada categoría y los aplica a los nuevos contenidos.
Este enfoque permite dar cuenta de muchas características lingüísticas a la vez, lo que lo hace más flexible que basarse en una única medida.
Sin embargo, el detector sigue realizando una clasificación probabilística. No tiene acceso directo a la identidad del autor ni dispone de un registro definitivo de quién escribió las palabras.
Preguntas frecuentes
¿Son precisos los detectores de IA?
Los detectores de IA pueden ser precisos en muchas situaciones, pero ninguno debe considerarse 100% fiable para todo tipo de texto. Los resultados pueden variar en función de la longitud del texto, el estilo de redacción, el modelo de IA y si el contenido ha sido editado o parafraseado.
¿Pueden los detectores de IA detectar ChatGPT?
Sí. Los detectores de IA pueden identificar patrones que suelen asociarse con textos generados por ChatGPT. Sin embargo, la detección no está garantizada, sobre todo cuando el contenido ha sido muy modificado, parafraseado o combinado con material escrito por personas.
¿Pueden los detectores de IA dar falsos positivos?
Sí. Se produce un falso positivo cuando un contenido escrito por una persona se clasifica erróneamente como generado por IA. La redacción predecible, los pasajes cortos y ciertos estilos de redacción formales pueden aumentar el riesgo de clasificaciones erróneas.
¿Por qué los detectores de IA marcan como «escrito por humanos» los textos escritos por personas?
Los detectores de IA analizan patrones que pueden aparecer tanto en los textos escritos por personas como en los generados por IA. Si un texto escrito por una persona es muy predecible, formal o tiene una estructura muy coherente, un detector podría asociar erróneamente esos patrones con contenido generado por IA.
¿Puede el texto generado por IA eludir los detectores de IA?
El texto generado por IA puede, en ocasiones, pasar desapercibido, sobre todo tras ser parafraseado, editado por personas u otras modificaciones. La eficacia de la detección también varía entre los distintos modelos de IA y los detectores individuales.
¿Qué detector de IA es el más preciso?
No existe un único detector que pueda considerarse el más preciso en todas las situaciones. En nuestra prueba con cinco muestras, Undetectable AI, GPTZero, QuillBot, ZeroGPT, Originality.ai y Monica clasificaron correctamente las cinco muestras. Se necesitarían pruebas más amplias y diversas para determinar su precisión de forma más generalizada.
¿Deberías fiarte de la puntuación de un detector de IA?
Considera la puntuación de un detector de IA como un indicador y no como una prueba definitiva de que el texto haya sido escrito por una IA. Para tomar decisiones importantes, compara varias herramientas y ten en cuenta el historial de redacción, los borradores, los registros de edición y otras pruebas disponibles.
Conclusión
Entonces, ¿son precisos los detectores de IA? Pueden resultar útiles, y nuestra prueba con cinco muestras demostró que varios detectores funcionaron muy bien en las mismas condiciones de prueba.
Sin embargo, un buen resultado en las pruebas de referencia no garantiza que el detector vaya a tener una precisión de 100% en todos los textos.
Los falsos positivos, los falsos negativos, las muestras cortas, la paráfrasis, la edición humana, la autoría compartida y los modelos de IA más recientes pueden afectar a los resultados de la detección.
El enfoque más fiable consiste en considerar un detector de IA como una herramienta de cribado. Utiliza muestras más largas, compara los resultados de varios detectores y ten en cuenta el contexto general del texto antes de tomar una decisión sobre la autoría.
Si quieres comparar los resultados de la detección de IA de tu propio contenido, prueba el AI Checker de IA indetectable como parte de tu proceso de revisión.