GPTZero se présente comme le détecteur d'IA le plus précis au monde. Il réalise également des tests comparatifs pour étayer cette affirmation.
Pourtant, on voit des gens sur Reddit et ailleurs se plaindre que GPTZero signale sans cesse à tort leurs textes.
Alors, qui dit la vérité ? Le meilleur moyen de le savoir est de tester l'outil, ce que j'ai fait.
Je m'appelle Christian Perry et je dirige Undetectable AI. Grâce à mon métier, je comprends bien comment fonctionnent les détecteurs d'IA sur différents types de contenus et à quel moment la plupart d'entre eux commencent à donner des résultats inexacts.
Je me suis appuyé sur mes connaissances et mon expérience pour mettre au point un petit test destiné à GPTZero. Ce test permettait de vérifier trois aspects de GPTZero :
- Précision de GPTZero sur du texte brut généré par l'IA
- Précision de GPTZero sur un texte généré par IA et humanisé à l'aide d'un outil d'IA
- Précision de GPTZero sur des textes manifestement rédigés par des humains
Cet article vous présentera les conclusions auxquelles je suis parvenu. Vous apprendrez également à interpréter ses résultats de manière responsable afin de ne pas utiliser cet outil à des fins pour lesquelles il n'a pas été conçu.
Principaux enseignements
- Lorsque j'ai soumis 8 échantillons à GPTZero lors de cette série de tests, l'outil les a tous détectés correctement, qu'il s'agisse du texte brut généré par l'IA, des versions « humanisées » ou des deux articles rédigés par des humains et publiés avant l'apparition des outils de rédaction basés sur l'IA.
- GPTZero annonce un taux de précision de 99,76% d'après ses propres tests comparatifs, mais je conseillerais de considérer avec prudence les chiffres communiqués par les entreprises elles-mêmes et de vous fier plutôt à des tests indépendants comme les miens avant de croire au battage médiatique.
- GPTZero détecte correctement les textes sans ambiguïté (entièrement rédigés par un humain ou entièrement générés par l'IA), mais il a plus de mal avec les textes mixtes, combinant contribution humaine et contribution de l'IA.
- Même si sa précision semble impressionnante, GPTZero vous donne une probabilité et non un verdict ; vous ne devriez donc jamais accuser un élève ou vous-même en vous basant uniquement sur son score, d’autant plus que les auteurs dont l’anglais n’est pas la langue maternelle sont signalés à tort plus souvent par les détecteurs d’IA que la plupart des gens ne le pensent.
Comment fonctionne GPTZero
GPTZero fonctionne de manière similaire à la plupart des autres détecteurs d'IA majeurs. Il analyse deux indicateurs statistiques principaux dans un texte :
- Perplexité : Ce terme fait référence au degré de prévisibilité de chaque mot en fonction des mots qui l'entourent. Les textes générés par l'IA ont généralement un faible indice de perplexité en raison de leur grande prévisibilité. Les humains ont tendance à choisir leurs mots de manière plus aléatoire, ce qui se traduit par un indice de perplexité élevé.
- L'éclatement : Ce signal mesure l'ampleur des variations de longueur et de complexité des phrases au sein d'un passage. Là encore, les textes rédigés par des humains présentent un niveau élevé de « burstiness », car nous écrivons par rafales aléatoires. Les textes générés par l'IA présentent quant à eux un faible niveau de « burstiness », car ils reposent sur des formules toutes faites.
Ce ne sont là que deux des nombreux indicateurs clés utilisés par GPTZero. Ils ont a publié un article technique en expliquant en détail leur architecture, notamment la manière dont ils traitent les textes paraphrasés et les documents mêlant contenu humain et IA.
Voilà donc le principe de base de GPTZero. Voyons maintenant si tout cela fonctionne bien dans la pratique et testons sa précision.
Ne vous inquiétez plus jamais de la détection de vos messages par l'IA. Undetectable AI peut vous aider :
- Faites apparaître votre écriture assistée par l'IA à l'image de l'homme.
- By-pass tous les principaux outils de détection de l'IA en un seul clic.
- Utilisation AI en toute sécurité et en toute confiance à l'école et au travail.
Précision annoncée par GPTZero vs conclusions indépendantes
En termes de précision, GPTZero se présente comme le détecteur d'IA le plus précis du marché.
Dans leur son propre critère de référence sur quatre domaines, ils indiquent avoir atteint une précision de 99,761 TP6T, avec un taux de faux positifs de 0,081 TP6T et un rappel de 99,601 TP6T. Ces chiffres sont sans aucun doute impressionnants. Mais ils proviennent de l'outil lui-même.
Des tests indépendants aboutissent à des conclusions plus ou moins similaires, à une légère différence près.
Je parle de ma dernière Comparaison de cinq détecteurs d'IA, parmi lesquels figurait également GPTZero.
Dans le cadre de cette comparaison, j’ai soumis 18 échantillons de texte (6 générés par l’IA brute, 6 générés par l’IA humanisée, 4 rédigés par des humains et 2 mixtes, à la fois humains et générés par l’IA) à GPTZero, qui a obtenu un score de précision de 100% sur presque tous les échantillons, à l’exception des échantillons mixtes.
Deux échantillons mixtes étaient composés de 60% humain et de 40% IA, et GPTZero a déclaré que les deux passages étaient d'origine humaine. Techniquement, ce verdict était correct selon le principe de la règle de la majorité.
Mais le problème, c'est que GPTZero a détecté 0% AI dans le premier échantillon mixte et seulement 14% AI dans l'autre échantillon mixte. En réalité, les deux textes correspondaient respectivement à 38% AI et 36% AI.
Cela signifie que la précision de GPTZero laisse à désirer lorsqu’il s’agit de textes résultant à la fois du travail d’un humain et de celui d’une IA.
Notre test : GPTZero est-il capable de détecter les textes générés par l'IA, et signale-t-il à tort des textes rédigés par des humains ?
Je souhaitais faire un petit complément à mon article précédent, en me concentrant cette fois-ci plus particulièrement sur GPTZero.
Depuis mes derniers tests, les chatbots IA et GPTZero ont tous deux mis à jour leurs modèles ; mon objectif avec ce test est donc de vérifier si GPTZero a conservé sa précision.
Pour ce test de suivi, j'ai travaillé avec 8 échantillons de texte.
- Le premier groupe d'échantillons était constitué de textes générés par l'IA. J'ai généré deux échantillons de texte à l'aide de Claude Opus 4.8 et deux autres à l'aide de GPT 5.5 de ChatGPT. J'ai ensuite sélectionné un échantillon dans chacun de ces deux ensembles et j'ai généré deux échantillons « humanisés » à l'aide de l'outil « humanizer » d'Undetectable AI.

- Le deuxième groupe d'échantillons était constitué d'écritures humaines. J'en ai choisi un Article de la BBC datant de 2020 et un article de recherche publié en 2021. Ces deux textes ont été publiés bien avant l’essor de l’IA ; il est donc impossible qu’ils aient été générés par l’IA. Par conséquent, si GPTZero les identifie comme issus de l’IA, il s’agirait clairement d’un faux positif.
J'ai ensuite analysé tous les échantillons à l'aide de GPTZero.
Voici les résultats obtenus par GPTZero pour chaque exemple :
| Échantillon | Référence | Verdict de GPTZero |
| Claude – Exemple 1 | Raw AI | 100% AI |
| Claude Exemple 2 | Raw AI | 100% AI |
| Exemple 1 de ChatGPT | Raw AI | 100% AI |
| Exemple ChatGPT n° 2 | Raw AI | 100% AI |
| Exemple 1 de Claude humanisé | IA humanisée | 92% IA, 8% Mixte |
| Exemple 1 de ChatGPT humanisé | IA humanisée | 100% AI |
| Article de la BBC (2020) | Humain | 100% Humain |
| Article de recherche (2021) | Humain | 100% Humain |
Comme vous pouvez le constater, le verdict et la précision de GPTZero sont parfaits sur tous les échantillons, à l'exception d'un seul échantillon « humanisé ».
Cet échantillon « humanisé » de Claude a obtenu un score IA de 92% et un score mixte de 8%. Là encore, le verdict est correct, seule la précision est légèrement erronée.
Mais malgré tout, l'outil « humanizer » d'Undetectable AI a réussi à faire légèrement pencher la balance. Pas assez, cependant, pour tromper GPTZero. Le score d'IA aurait peut-être été encore plus bas si j'avais utilisé la version premium de l'« humanizer » d'Undetectable AI.

Le problème des faux positifs dans la reconnaissance de l'écriture manuscrite
GPTZero n'a généré aucun faux positif lors de ce test, quel que soit l'échantillon. Cela ne signifie toutefois pas que les faux positifs ne constituent pas un problème pour les détecteurs d'IA en général.
La raison pour laquelle ce problème se pose avec les détecteurs d'IA est simple. Pour ces derniers, un texte présentant une faible perplexité et une faible variabilité est très probablement généré par une IA.
Mais ces deux schémas peuvent également apparaître dans des textes véritablement rédigés par des humains, en particulier dans des contextes formels où les auteurs doivent respecter des consignes strictes.
C'est également pour cette raison que l'on constate souvent que des essais soignés, rédigés par des personnes dont l'anglais n'est pas la langue maternelle, sont identifiés comme ayant été générés par une IA, alors qu'ils ont bien été écrits par des humains. Cela s'explique par le fait que les auteurs non natifs ont souvent recours à des structures de phrases plus ’ sûres » et disposent d'un vocabulaire moins étendu.
En mon dernier test comparatif portant sur 18 échantillons, les cinq détecteurs (y compris GPTZero) ont tous affiché un score d’IA égal ou inférieur à 8% pour chaque texte rédigé par un humain, qu’il s’agisse d’un locuteur natif ou d’un apprenant de l’anglais. Ainsi, lors de cette série de tests, aucun faux positif n’a été détecté.
Mais les exemples d'ESL que j'ai utilisés provenaient d'auteurs publiés et s'exprimant clairement. Un lycéen rédigeant une dissertation universitaire dans sa deuxième langue peut représenter un cas bien plus difficile pour les détecteurs d'IA.
Comment interpréter de manière responsable les résultats de GPTZero
En fin de compte, GPTZero est un outil fondé sur les probabilités. Son score ne doit donc pas être considéré comme un verdict définitif.
Voici comment vous devriez plutôt interpréter ces résultats :
- Ne considérez pas ce résultat comme un verdict de culpabilité. Si, par exemple, vous obtenez un score de 87% AI, cela signifie que les caractéristiques statistiques du texte correspondent fortement aux modèles que le détecteur a été entraîné à signaler comme provenant d’une IA. Mais il ne s’agit toujours que d’une prédiction, et non d’une preuve. L’auteur pourrait tout à fait être un humain, surtout si le score se situe dans la fourchette intermédiaire (entre 40% et 70%, en gros).
- N’accusez jamais personne (ni vous-même) en vous basant uniquement sur le verdict d’un seul détecteur d’IA. Vérifiez le texte à l’aide d’autres principaux détecteurs d'IA. Si tous ou la plupart d'entre eux s'accordent à dire que le texte a été généré par une IA, il se peut effectivement que tout ou partie de ce texte soit le fruit d'une IA. Dans ce cas, vous devriez essayer d'« humaniser » le texte, soit par vous-même, soit à l'aide d'un un outil d'humanisation tel que « Undetectable AI ».
- Tenez compte des faux positifs, en particulier chez les auteurs dont l'anglais n'est pas la langue maternelle. Si vous êtes enseignant et que le texte d'un élève a été signalé comme étant généré par une IA, demandez-vous si cela pourrait s'expliquer par le fait que cet élève est un apprenant de l'anglais langue étrangère (ESL) et qu'il suit simplement un style d'écriture rigide.
- Interrogez l'élève sur son processus de rédaction. Vous pouvez lui demander de vous montrer ses premières ébauches ou ses notes. S'il est capable de parler de son travail et d'en expliquer les concepts, le texte peut être considéré comme original.
FAQ
Quelle est la précision de GPTZero ?
GPTZero, dans son propre test de performance publié, fait état d'une précision de 99,76% avec un taux de faux positifs de 0,08%. Lors de ma dernière série de tests et de celle en cours, GPTZero conserve des taux de précision élevés. Cependant, il lui arrive parfois de détecter à tort des textes rédigés par des humains comme provenant de l'IA. De plus, il rencontre principalement des difficultés avec les échantillons mixtes.
GPTZero génère-t-il des faux positifs ?
GPTZero peut générer des faux positifs, car aucun détecteur d’IA n’est précis à 100% et ne doit pas être considéré comme tel. Les détecteurs d’IA tels que GPTZero peuvent se tromper, en particulier lorsqu’il s’agit de textes rédigés par des humains.
Beaucoup de utilisateurs de Reddit ont signalé que leur texte avait été classé à tort comme « IA » par GPTZero.
GPTZero va-t-il signaler ma dissertation rédigée par un humain ?
C'est possible, surtout si votre texte est formel ou stéréotypé. C'est pourquoi un seul résultat de GPTZero ne doit jamais être considéré comme une preuve d'utilisation de l'IA.
Les établissements scolaires devraient-ils se fier uniquement à GPTZero ?
Non. Aucun établissement scolaire ne devrait s'appuyer sur un seul détecteur d'IA pour prendre des décisions en matière d'intégrité académique. Le risque de faux positif est faible, mais pas nul, et les conséquences d'une accusation injustifiée à l'encontre d'un élève sont graves. Si les établissements utilisent GPTZero, ils devraient le considérer comme un indice parmi d'autres.
Réflexions finales
La précision de GPTZero s'est avérée élevée lors de ce test, tout comme la dernière fois que je l'ai testé.
Mais ce test comprenait 8 exemples de textes simples. Si j’avais inclus des exemples tirés de véritables salles de classe ou de lieux de travail, nous aurions pu constater que GPTZero générait des faux positifs.
En parlant de détecteurs d'IA précis et de la nécessité d'obtenir l'avis de plusieurs détecteurs d'IA avant de se forger une opinion, vous pouvez analyser votre contenu à l'aide d'Undetectable AI Detector pour obtenir gratuitement un deuxième avis.
Obtenez un deuxième avis sur votre contenu grâce à Undetectable AI’s Détecteur d'IA et découvrez les performances de votre texte.