Les détecteurs d'IA sont-ils précis ? La vérité derrière les outils

Les détecteurs d'IA peuvent s'avérer utiles pour identifier les schémas couramment observés dans les textes générés par l'IA, mais aucun détecteur n'est précis à 100% dans toutes les situations.

Alors, les détecteurs d'IA sont-ils fiables ? La réponse dépend de l'outil utilisé, du type et de la longueur du texte analysé, du modèle d'IA utilisé pour le générer, ainsi que du fait que le contenu ait été modifié ou paraphrasé.

Les modèles d'IA modernes sont capables de produire des textes qui ressemblent fortement à ceux rédigés par des humains, tandis que les textes humains peuvent parfois paraître suffisamment prévisibles pour déclencher un détecteur d'IA. Cela soulève deux problèmes courants : les faux positifs, où un texte humain est identifié comme provenant de l'IA, et les faux négatifs, où un texte généré par l'IA est classé comme étant d'origine humaine.

Afin d'évaluer les performances des différents outils, nous avons testé 10 détecteurs d'IA populaires à l'aide d'un même ensemble de référence composé de cinq textes. L'objectif n'était pas de démontrer qu'un détecteur quelconque offre une précision universelle, mais de comparer la régularité de leurs performances dans les mêmes conditions.

Voici ce que nous avons découvert.


Principaux enseignements

  • Les détecteurs d'IA recherchent des schémas tels que la prévisibilité des mots, la variation des phrases, la syntaxe et d'autres caractéristiques associées aux textes générés par l'IA.

  • Aucun détecteur d'IA n'est totalement fiable. Des faux positifs et des faux négatifs peuvent se produire, en particulier avec des textes courts, modifiés ou très prévisibles.

  • Notre test portant sur cinq échantillons a révélé des différences importantes entre les détecteurs : plusieurs outils ont correctement classé les cinq échantillons, tandis que d'autres en ont manqué un ou plusieurs.

  • Le score attribué par un détecteur doit être considéré comme un indicateur, et non comme une preuve irréfutable de l'identité de l'auteur d'un contenu.

  • Pour obtenir de meilleurs résultats, testez des extraits plus longs, comparez les résultats obtenus avec plusieurs outils et tenez compte de la manière dont le contenu a été créé et modifié.


Qu'est-ce qu'un détecteur d'IA et comment fonctionne-t-il ?

Les détecteurs d'IA sont des outils conçus pour déterminer si un texte a été rédigé par un être humain ou généré par l'intelligence artificielle.

Au lieu de repérer une mention cachée indiquant “ généré par l'IA ”, la plupart des détecteurs analysent les caractéristiques propres au texte. Il peut s'agir notamment du choix des mots, de la structure des phrases, de la prévisibilité, de la syntaxe et des schémas appris à partir de vastes corpus de textes rédigés par des humains ou générés par l'IA.

Écriture générée par l'IA peuvent présenter des caractéristiques statistiques qui diffèrent de celles de l'écriture humaine classique. Étant donné que les modèles linguistiques génèrent du texte en prédisant des séquences de mots probables, leurs résultats peuvent parfois sembler plus prévisibles ou plus cohérents que du contenu rédigé naturellement.

Détection de l'IA Détection de l'IA

Ne vous inquiétez plus jamais de la détection de vos messages par l'IA. Undetectable AI peut vous aider :

  • Faites apparaître votre écriture assistée par l'IA à l'image de l'homme.
  • By-pass tous les principaux outils de détection de l'IA en un seul clic.
  • Utilisation AI en toute sécurité et en toute confiance à l'école et au travail.
Essaie GRATUITEMENT

Deux concepts souvent associés à la détection de l'IA sont la perplexité et la granularité.

Perplexité

La perplexité mesure le degré de prévisibilité d'une séquence de mots pour un modèle linguistique.

Un score de perplexité plus faible indique généralement que le texte est plus facile à prédire. Les textes générés par l'IA peuvent parfois présenter une perplexité plus faible, car les modèles linguistiques ont tendance à sélectionner des séquences de mots statistiquement probables.

Les auteurs humains font preuve de moins de cohérence. Ils peuvent employer des expressions inhabituelles, des choix lexicaux inattendus, des tournures personnelles ou des structures de phrases plus difficiles à anticiper.

Cependant, la perplexité à elle seule ne suffit pas à prouver de manière fiable la paternité d'un texte. L'écriture humaine peut également être très prévisible, en particulier lorsque le sujet est technique, formel ou répétitif.

L'éclatement

La « burstiness » désigne la variation de la longueur, de la structure et du rythme des phrases.

Les textes rédigés par des humains contiennent souvent un mélange de phrases courtes et longues. Les textes générés par l'IA peuvent parfois sembler plus uniformes, avec des structures de phrases et un rythme similaires tout au long d'un passage.

Les modèles linguistiques modernes ont toutefois considérablement amélioré leur capacité à varier leurs résultats. Cela rend la « burstiness » moins utile en tant que signal isolé et explique en partie pourquoi les systèmes actuels de détection de l'IA s'appuient généralement sur plusieurs signaux plutôt que sur une simple mesure.

Pourquoi la détection de l'IA est-elle si difficile ?

Le principe de base de la détection de l'IA semble simple : identifier les caractéristiques qui distinguent les textes rédigés par des humains de ceux générés par des machines.

Dans la pratique, cette frontière est bien moins nette.

L'écriture humaine et celle générée par l'IA utilisent le même langage. Les modèles d'IA sont entraînés à partir de contenus créés par des humains ; ils acquièrent ainsi bon nombre des structures grammaticales, des schémas lexicaux et des conventions d'écriture que les humains utilisent.

Cela pose plusieurs défis aux systèmes de détection.

Les textes rédigés par des humains et ceux générés par l'IA peuvent se ressembler

Les modèles d'IA sont conçus pour produire un langage naturel. À mesure que ces modèles s'améliorent, leurs textes peuvent devenir moins répétitifs et mieux adaptés au contexte.

Par ailleurs, les gens ont souvent tendance à écrire de manière prévisible. Les textes universitaires, la communication d'entreprise, les descriptions de produits et la documentation technique peuvent suivre des structures bien établies qu'un détecteur d'IA pourrait interpréter comme étant générées par une machine.

Cela signifie qu’un détecteur ne se contente pas de se demander : “ Est-ce que cela ressemble à de l’IA ? ”

Il s'agit d'évaluer si les caractéristiques statistiques et linguistiques du texte correspondent davantage aux schémas qu'il associe aux contenus générés par l'IA.

Faux positifs et faux négatifs

On parle de « faux positif » lorsqu'un texte rédigé par un humain est classé à tort comme ayant été généré par l'IA.

Un faux négatif, c'est le contraire : un texte généré par l'IA est classé comme ayant été rédigé par un humain.

Les deux sont importants.

Un faux positif peut poser problème lorsqu'une personne est accusée d'avoir utilisé l'IA alors qu'elle a rédigé elle-même le contenu. Un faux négatif peut permettre à un contenu généré par l'IA de passer à travers un système de détection sans être signalé.

Des études ont également montré que les performances des détecteurs peuvent varier considérablement en fonction du type de texte, du modèle utilisé et du fait que le contenu ait été modifié ou non.

Les modèles d'IA ne cessent d'évoluer

La détection de l'IA est une cible mouvante, car les systèmes qui génèrent le texte évoluent sans cesse.

Les anciens modèles d'IA produisaient souvent des schémas plus évidents, notamment des tournures répétitives et des structures prévisibles. Les modèles plus récents sont capables de produire des textes plus variés et de mieux s'adapter au contexte.

Cela ne signifie pas pour autant que les contenus modernes générés par l'IA soient impossibles à détecter. Cela signifie simplement que les développeurs de systèmes de détection doivent mettre à jour en permanence leurs outils afin de tenir compte des nouveaux modèles et des nouveaux styles d'écriture.

Quelle est la précision des détecteurs d'IA aujourd'hui ?

Il n'existe pas de chiffre unique exprimant la précision qui s'applique à tous les détecteurs d'IA.

Un outil peut donner d'excellents résultats sur des textes générés par l'IA sans modification, mais rencontrer des difficultés avec des contenus paraphrasés ou modifiés par un humain. Un autre détecteur peut se montrer plus prudent et produire moins de faux positifs, mais passer à côté de certains passages générés par l'IA.

Des études indépendantes confirment cette tendance. Certains détecteurs peuvent donner d'excellents résultats dans des conditions de test spécifiques, mais leurs performances peuvent baisser lorsque le texte est modifié ou lorsque le test porte sur différents types d'écrits.

C'est pourquoi des affirmations telles que “ précision 100% ” doivent être interprétées avec prudence.

Un détecteur peut obtenir un score de 100% lors d'un test de performance donné sans pour autant afficher une précision de 100% pour tous les textes, modèles, genres ou situations réelles possibles.

Le Étude ZDNet L'étude qui a inspiré nos tests a évalué plusieurs détecteurs d'IA à l'aide de cinq échantillons : trois générés par ChatGPT et deux rédigés par des humains.

Nous avons utilisé le même critère de référence de base pour notre comparaison.

Ces résultats offrent un aperçu utile des performances de ces outils sur les mêmes échantillons. Ils ne doivent toutefois pas être considérés comme un classement universel de la précision de détection de l'IA.

Comment nous avons testé 10 détecteurs d'IA

Stratégie d'entreprise objectifs de réussite

Afin de garantir une comparaison aussi cohérente que possible, nous avons testé 10 détecteurs d'IA à l'aide des cinq mêmes échantillons de texte.

Le test de référence comprenait :

  • Trois exemples générés par l'IA à l'aide de ChatGPT.
  • Deux exemples rédigés par des humains.
  • Le même texte a été soumis à chaque détecteur.
  • Les résultats ont été consignés en fonction de la capacité de chaque outil à classer correctement l'échantillon.
  • Un résultat était considéré comme correct lorsque le score du détecteur atteignait le seuil utilisé dans notre test.

Par souci de cohérence avec la méthodologie initiale inspirée de ZDNet, un score de probabilité d’IA supérieur à 70% a été considéré comme un cas d’IA.

La précision a été calculée en divisant le nombre d'échantillons correctement classés par le nombre total de cinq échantillons.

Par exemple, un détecteur ayant correctement classé quatre des cinq échantillons a obtenu un score de précision de 80%.

Ces tests ont été réalisés dans le cadre de la comparaison initiale présentée dans cet article. Les détecteurs d'IA et les modèles sur lesquels ils reposent évoluant au fil du temps, ces résultats doivent être considérés comme le fruit d'un test ponctuel plutôt que comme un classement définitif.

Surtout, cinq exemples ne suffisent pas pour garantir une précision universelle. Un ensemble de référence plus vaste, comprenant davantage de styles d'écriture, de longueurs de texte, de modèles d'IA, de langues et d'exemples révisés, permettrait d'évaluer de manière plus fiable les performances en conditions réelles.

Résultats des tests de précision du détecteur d'IA

Voici un aperçu simplifié des performances des 10 détecteurs lors de notre test réalisé sur cinq échantillons.

Détecteur d'IARésultats correctsPrécision des tests
IA indétectable5/5100%
GPTZero5/5100%
QuillBot5/5100%
ZeroGPT5/5100%
Originalité.ai5/5100%
Monica5/5100%
Copyleaks4/580%
Grammarly3/560%
Writer.com3/560%
L'aubier0/50%

Ces résultats ne concernent que ce test spécifique portant sur cinq échantillons. Ils ne doivent pas être interprétés comme signifiant qu'un détecteur conservera la même précision sur chaque contenu.

IA indétectable

Résultat du test : 5/5 bonnes réponses

Précision : 100%

Ce qui s'est passé : L'IA « indétectable » a correctement classé les cinq échantillons de notre test, qu'il s'agisse des échantillons rédigés par des humains ou des trois échantillons générés par l'IA.

Ce résultat lui a permis de figurer parmi les meilleurs de cette comparaison.

La plateforme utilise plusieurs signaux de détection plutôt que de se fonder sur une seule caractéristique de l'écriture. Ce type d'approche multisignale est utile car aucune caractéristique isolée, telle que la longueur des phrases ou la prévisibilité des mots, ne suffit à elle seule à établir la paternité d'un texte.

À retenir : L'IA « indétectable » a affiché des performances constantes sur l'ensemble des cinq échantillons de notre test, mais ce résultat reflète davantage cette référence que la précision universelle du modèle 100%.

GPTZero

Résultat du test : 5/5 bonnes réponses

Précision : 100%

Ce qui s'est passé : GPTZero a correctement classé les cinq échantillons selon le seuil défini pour nos tests.

Il a attribué des probabilités d'IA très élevées à certains des échantillons générés, tout en identifiant correctement les échantillons rédigés par des humains.

Les résultats montrent que GPTZero donne de bons résultats sur des échantillons clairement distincts provenant d'humains et d'IA, même si d'autres études ont révélé que ses performances peuvent varier en fonction de la longueur du texte et du type d'écriture.

À retenir : GPTZero a obtenu de bons résultats lors de ce test, mais son score doit tout de même être interprété en tenant compte du type et de la longueur du texte analysé.

Copyleaks

Résultat du test : 4 sur 5 de bonnes réponses

Précision : 80%

Ce qui s'est passé : Copyleaks a classé à tort le premier échantillon rédigé par un humain comme étant généré par l'IA « 100% ».

Il a également identifié plusieurs expressions comme pouvant être liées à l'IA, bien que l'échantillon ait été rédigé par une personne.

Les quatre échantillons restants ont été correctement classés.

Copyleaks a ainsi obtenu une précision globale de 80% lors de notre test.

À retenir : Copyleaks a donné de bons résultats dans l'ensemble, mais a montré qu'un détecteur performant pouvait tout de même générer un faux positif lorsqu'il s'agit d'un texte rédigé par un humain.

QuillBot

Résultat du test : 5/5 bonnes réponses

Précision : 100%

Ce qui s'est passé : QuillBot a correctement identifié les cinq exemples de notre test.

Cet outil est surtout connu pour ses fonctionnalités de rédaction et de paraphrase, mais son détecteur d'IA a également obtenu d'excellents résultats par rapport à la référence.

Ses résultats montrent pourquoi la détection par IA doit être évaluée à l'aide de tests concrets plutôt que sur la base d'hypothèses fondées sur les fonctionnalités pour lesquelles un outil est principalement connu.

À retenir : QuillBot a correctement classé tous les exemples de ce test et s'est révélé l'un des outils les plus performants de ce comparatif.

ZeroGPT

Résultat du test : 5/5 bonnes réponses

Précision : 100%

Ce qui s'est passé : ZeroGPT a classé le premier échantillon rédigé par un humain comme étant généré par l'IA (0%) et le second comme étant généré par l'IA (9,44%).

Selon nos critères de test, les deux ont été considérés comme rédigés par un humain.

Il a également correctement identifié les trois exemples générés par l'IA comme étant rédigés par l'IA.

À retenir : Dans ce test comparatif portant sur cinq textes, ZeroGPT a produit des résultats cohérents tant pour les échantillons générés par l'homme que pour ceux générés par l'IA.

Grammarly

Résultat du test : 3 bonnes réponses sur 5

Précision : 60%

Ce qui s'est passé : Grammarly a donné des résultats mitigés.

Il a correctement identifié deux des trois échantillons générés par l'IA, avec des probabilités d'IA de 92% et 81%. Le troisième échantillon généré par l'IA a obtenu un score d'IA de 54% et n'a donc pas été considéré comme une identification correcte par l'IA selon notre seuil.

Il a également correctement identifié un échantillon rédigé par un humain, mais a classé l'autre comme étant généré par l'IA.

À retenir : Les résultats de Grammarly se sont révélés moins constants que ceux des outils les plus performants dans ce test précis.

Originalité.ai

Résultat du test : 5/5 bonnes réponses

Précision : 100%

Ce qui s'est passé : Originality.ai a correctement identifié les cinq échantillons et a fourni des scores de confiance élevés tant pour le contenu généré par l'IA que pour celui rédigé par des humains.

La plateforme est spécialement conçue pour la vérification des contenus et intègre un système de détection par IA ainsi que d'autres fonctionnalités d'analyse des contenus.

Ses performances lors de ce test ont été constantes pour les deux types d'échantillons.

À retenir : Originality.ai a correctement classé les cinq échantillons de notre test comparatif, même si cela ne garantit pas une précision universelle.

Writer.com

Résultat du test : 3 bonnes réponses sur 5

Précision : 60%

Ce qui s'est passé : Le détecteur de Writer.com a correctement classé trois des cinq échantillons, mais a identifié à tort deux échantillons rédigés par une IA comme étant l'œuvre d'un humain.

Cela signifie que le détecteur a généré des faux négatifs lors de notre test.

Il s'agit là d'une distinction importante, car un détecteur peut paraître prudent tout en passant à côté de contenus générés par l'IA.

À retenir : Writer.com a affiché des performances inégales lors de notre test de performance, notamment lors de l'identification de certains échantillons générés par l'IA.

Monica

Résultat du test : 5/5 bonnes réponses

Précision : 100%

Ce qui s'est passé : Lors de notre test, Monica a correctement identifié les cinq échantillons sans commettre la moindre erreur.

Ses résultats se sont révélés cohérents tant pour les échantillons rédigés par des humains que pour ceux générés par l'IA.

À retenir : Monica a obtenu d'excellents résultats lors de ce test de référence, en classifiant correctement les cinq échantillons.

Détecteur d'IA de l'aubier

Résultat du test : 0/5 de bonnes réponses lors de l'évaluation initiale

Précision : 0%

Ce qui s'est passé : Lors de notre test, Sapling a généré plusieurs classifications erronées, notamment en identifiant deux échantillons rédigés par des humains comme étant générés par l'IA (100%).

Ce résultat a mis en évidence l'un des principaux problèmes liés à la détection de l'IA : un score d'IA très élevé ne signifie pas nécessairement que le texte a été généré par l'IA.

Sapling a lui-même reconnu ses limites en matière de faux positifs, notamment avec des textes courts.

À retenir : Sapling a obtenu de mauvais résultats lors de ce test de performance spécifique, ce qui montre pourquoi il convient d'interpréter les résultats des détecteurs avec prudence.

Pourquoi les détecteurs basés sur l'IA génèrent-ils des faux positifs ?

On parle de « faux positif » lorsqu'un détecteur d'IA classe un contenu rédigé par un humain comme étant généré par l'IA.

Cela peut s'expliquer par plusieurs raisons.

L'écriture humaine peut être prévisible

Les gens n'écrivent pas toujours de manière très variée.

Les essais formels, les documents techniques, les articles universitaires, les e-mails professionnels et les contenus pédagogiques recourent souvent à un vocabulaire et à des structures de phrases conventionnels.

Un détecteur cherchant à identifier des schémas linguistiques prévisibles pourrait donc considérer certains textes rédigés par des humains comme similaires à des textes générés par l'IA.

Un texte court fournit moins d'informations aux détecteurs

Un détecteur a besoin d'une quantité suffisante de texte pour analyser des schémas significatifs.

Les passages courts fournissent moins d'indices. Quelques phrases peuvent ne pas présenter suffisamment de variations au niveau du vocabulaire, de la syntaxe ou du rythme pour permettre une prédiction fiable.

C'est l'une des raisons pour lesquelles certains systèmes de détection mettent en garde les utilisateurs contre le fait de considérer les scores obtenus à partir de textes courts comme définitifs.

Une écriture prévisible peut ressembler à celle d'une IA

Une personne qui écrit de manière claire et cohérente peut produire un texte statistiquement prévisible.

Par exemple, une phrase telle que “ L'étude a examiné les effets de l'IA sur l'éducation ” suit une structure très classique.

Ce n'est pas en soi le signe d'une création par IA, mais un langage très prévisible peut influencer le score attribué par un détecteur d'IA.

L'édition peut créer de nouveaux motifs

La révision humaine ne facilite pas toujours la classification d'un texte.

Lorsqu'une personne remanie en profondeur un texte généré par l'IA, le résultat peut présenter un mélange de schémas propres à l'IA et de schémas propres à l'humain. Il en va de même lorsqu'une personne corrige son propre texte pour en améliorer la clarté ou la cohérence.

Il est donc plus difficile de déterminer si le texte final a été rédigé exclusivement par un être humain ou s'il a été généré exclusivement par une intelligence artificielle.

Pourquoi les détecteurs d'IA ne repèrent-ils pas les textes générés par l'IA ?

On parle de « faux négatifs » lorsque du contenu généré par l'IA est classé comme ayant été rédigé par un humain.

Cela peut se produire lorsque le texte ne correspond plus aux modèles attendus par un détecteur.

La paraphrase peut modifier les signaux de détection

La réécriture d'un texte généré par l'IA peut modifier le vocabulaire, la structure des phrases et l'ordre des mots.

Même si le contenu d'origine provenait d'un modèle d'IA, des modifications suffisantes peuvent compliquer la tâche d'un détecteur pour reconnaître les schémas statistiques d'origine.

Des études ont montré que certains détecteurs affichent des performances nettement inférieures lorsque le texte généré par l'IA a été paraphrasé ou modifié.

La révision humaine modifie le résultat initial

Les gens modifient souvent les contenus générés par l'IA avant de les publier.

Ils peuvent ajouter des exemples personnels, supprimer des expressions répétitives, modifier la structure des phrases ou réécrire des passages entiers.

La version finale n'est plus le même texte que celui généré par le modèle, ce qui peut compliquer sa détection.

Les nouveaux modèles d'IA produisent des textes plus variés

Les modèles d'IA continuent d'améliorer leur capacité à tenir compte du contexte et à varier leur style d'écriture.

Cela signifie que les détecteurs doivent sans cesse s'adapter.

Une méthode de détection qui s'est avérée efficace face à une génération de modèles peut ne pas donner les mêmes résultats face à un modèle plus récent ou à un autre type de texte généré.

Les contenus mêlant contenu humain et IA sont plus difficiles à classer

De nombreux documents réels ne sont ni entièrement rédigés par des humains, ni entièrement générés par l'IA.

Une personne pourrait rédiger elle-même l'introduction, utiliser l'IA pour créer un plan, générer quelques paragraphes, puis tout réviser manuellement.

Le document final comporte plusieurs auteurs.

Un simple pourcentage ne permet pas toujours de refléter fidèlement cette complexité.

Peut-on se fier au score d'un détecteur d'IA ?

Vous pouvez vous servir du score d'un détecteur d'IA comme indicateur utile, mais vous ne devez pas le considérer comme une preuve définitive de la paternité d'un texte.

Par exemple, un résultat indiquant « 95% généré par l'IA » ne signifie pas qu'il y ait une certitude de 95% que le texte ait été rédigé par l'IA.

Ce pourcentage correspond à l'évaluation effectuée par le détecteur sur la base de son propre modèle et de son propre système de notation.

Différents détecteurs peuvent également attribuer des notes différentes pour un même passage.

C'est important car le résultat obtenu par un détecteur dépend des données d'entraînement du système, de son approche de détection, du seuil fixé et des hypothèses formulées quant aux caractéristiques de la rédaction générée par l'IA.

Des études indépendantes ont montré que même les détecteurs les plus performants peuvent générer des faux positifs et des faux négatifs, et que leurs performances varient selon les différents types de contenus, qu'ils soient générés par l'IA ou rédigés par des humains.

Pour les décisions aux enjeux importants, un détecteur d'IA devrait donc être considéré comme un élément de preuve parmi d'autres, et non comme une référence absolue.

Comment utiliser les détecteurs d'IA de manière plus fiable

Les détecteurs d'IA peuvent s'avérer plus utiles si on les considère comme des outils de présélection plutôt que comme des juges absolus.

Voici quelques conseils pratiques pour améliorer vos résultats.

Utilisez suffisamment de texte

Dans la mesure du possible, analysez un passage significatif plutôt qu'une simple phrase ou un paragraphe très court.

Des échantillons plus longs fournissent au détecteur davantage d'informations linguistiques sur lesquelles s'appuyer.

Comparer plusieurs détecteurs

Ne vous fiez pas à un seul résultat.

Si plusieurs outils indépendants identifient le même passage comme étant susceptible d'avoir été généré par une IA, cela constitue un indice plus fiable qu'un résultat provenant d'un seul détecteur.

L'inverse est également vrai. Si un détecteur attribue un score d'IA élevé alors que plusieurs autres identifient le texte comme étant de provenance humaine, le résultat mérite d'être examiné de plus près.

Consultez le contexte d'origine

Demandez-vous d'où provient ce contenu et comment il a été créé.

Ce texte a-t-il été entièrement rédigé par une personne ? L'IA a-t-elle été utilisée pour trouver des idées ? Le contenu a-t-il été généré puis largement retravaillé ?

Comprendre le processus d'écriture peut fournir des informations qu'un détecteur d'IA n'est pas en mesure de percevoir.

Considérez le score comme un indicateur

Un score très élevé ou très faible peut être utile, mais il ne doit pas régler automatiquement la question de la paternité de l’œuvre.

Utilisez ce résultat pour déterminer s'il est nécessaire de procéder à un examen plus approfondi.

Conservez les traces du processus d'écriture

Pour les travaux importants, les brouillons, l'historique des révisions, les notes et autres documents peuvent constituer des preuves plus solides de la paternité d'un texte qu'un simple score obtenu à l'aide d'un détecteur d'IA.

Cela s'avère particulièrement utile dans les domaines de l'éducation, de l'édition, du recrutement et dans d'autres situations où une accusation infondée peut avoir de graves conséquences.

Explication des méthodes courantes de détection de l'IA

Les détecteurs d'IA utilisent différentes combinaisons d'analyses statistiques, d'apprentissage automatique et d'autres techniques.

Il n'existe pas d'approche unique qui fonctionne parfaitement dans toutes les situations.

Modélisation statistique du langage

Les méthodes statistiques permettent d'étudier la probabilité que certains mots, expressions et structures de phrases apparaissent ensemble.

La « perplexité » et la « sporadicité » sont deux concepts souvent associés à cette approche.

L'objectif est d'identifier les schémas qui apparaissent plus fréquemment dans les textes générés par l'IA que dans ceux rédigés par des humains.

Métadonnées et filigrane

Les métadonnées peuvent fournir des informations sur la manière dont un contenu a été créé, lorsque ces informations sont disponibles.

Le tatouage numérique adopte une approche différente. Au lieu d'analyser uniquement le texte final, un tatouage numérique peut être intégré dès le processus de création.

Certaines études ont démontré que le tatouage numérique de texte pouvait être mis en œuvre à grande échelle, notamment grâce au système SynthID-Text de Google destiné aux contenus générés par Gemini.

Cependant, le tatouage numérique ne revient pas à une détection classique par IA, et son efficacité dépend de la manière dont le tatouage est mis en œuvre et du fait que le texte ait été modifié par la suite ou non.

Des études ont également montré que certains systèmes de tatouage numérique peuvent perdre de leur efficacité après une réécriture ou d'autres transformations.

Classificateurs d'apprentissage automatique

De nombreux détecteurs d'IA modernes utilisent des modèles d'apprentissage automatique entraînés à partir d'exemples de textes rédigés par des humains et générés par l'IA.

Le détecteur apprend les modèles associés à chaque catégorie et applique ces modèles à de nouveaux contenus.

Cette approche permet de prendre en compte simultanément de nombreuses caractéristiques linguistiques, ce qui la rend plus flexible que le recours à une seule mesure.

Cependant, le détecteur procède toujours à une classification probabiliste. Il n’a pas directement accès à l’identité de l’auteur ni à une information définitive permettant d’identifier la personne qui a tapé ces mots.

Questions fréquemment posées

Les détecteurs d'IA sont-ils précis ?

Les détecteurs d'IA peuvent être précis dans de nombreuses situations, mais aucun ne doit être considéré comme fiable à 100% pour tous les types de textes. Les résultats peuvent varier en fonction de la longueur du texte, du style rédactionnel, du modèle d'IA utilisé et du fait que le contenu ait été modifié ou paraphrasé.

Les détecteurs d'IA peuvent-ils repérer ChatGPT ?

Oui. Les détecteurs d'IA sont capables d'identifier les schémas généralement associés aux textes générés par ChatGPT. Cependant, la détection n'est pas garantie, en particulier lorsque le contenu a été fortement modifié, paraphrasé ou combiné avec du contenu rédigé par un humain.

Les détecteurs d'IA peuvent-ils générer des faux positifs ?

Oui. On parle de « faux positif » lorsqu'un contenu rédigé par un humain est classé à tort comme ayant été généré par l'IA. Une écriture prévisible, des passages courts et certains styles d'écriture formels peuvent augmenter le risque d'erreurs de classification.

Pourquoi les détecteurs d'IA signalent-ils les textes rédigés par des humains ?

Les détecteurs d'IA analysent les schémas susceptibles d'apparaître aussi bien dans les textes rédigés par des humains que dans ceux générés par l'IA. Si un texte rédigé par un humain est très prévisible, formel ou présente une structure très cohérente, un détecteur peut associer à tort ces schémas à un contenu généré par l'IA.

Un texte généré par l'IA peut-il échapper aux détecteurs d'IA ?

Les textes générés par l'IA peuvent parfois échapper à la détection, notamment après avoir été paraphrasés, révisés par un humain ou soumis à d'autres modifications. L'efficacité de la détection varie également selon les modèles d'IA et les détecteurs utilisés.

Quel détecteur d'IA est le plus précis ?

Il n'existe pas de détecteur unique pouvant être considéré comme le plus précis dans toutes les situations. Lors de notre test portant sur cinq échantillons, Undetectable AI, GPTZero, QuillBot, ZeroGPT, Originality.ai et Monica ont correctement classé les cinq échantillons. Des tests à plus grande échelle et plus variés seraient nécessaires pour établir une précision plus générale.

Faut-il se fier au score attribué par un détecteur d'IA ?

Considérez le score attribué par un détecteur d'IA comme un indicateur plutôt que comme une preuve irréfutable de la paternité d'un texte par l'IA. Pour les décisions importantes, comparez plusieurs outils et tenez compte de l'historique de rédaction, des brouillons, des modifications apportées et de tout autre élément de preuve disponible.

Conclusion

Alors, les détecteurs d'IA sont-ils fiables ? Ils peuvent s'avérer utiles, et notre test réalisé sur cinq échantillons a montré que plusieurs d'entre eux donnaient d'excellents résultats dans les mêmes conditions d'essai.

Cependant, un excellent résultat aux tests de performance ne signifie pas pour autant qu’un détecteur sera précis à 100% sur chaque texte.

Les faux positifs, les faux négatifs, les échantillons courts, la paraphrase, la révision humaine, la co-rédaction et les nouveaux modèles d'IA peuvent tous influencer les résultats de détection.

La meilleure approche consiste à considérer un détecteur d'IA comme un outil de présélection. Utilisez des extraits plus longs, comparez les résultats obtenus par plusieurs détecteurs et tenez compte du contexte global du texte avant de vous prononcer sur la paternité de l'œuvre.

Si vous souhaitez comparer les résultats de détection par IA de vos propres contenus, essayez l'outil Vérificateur d'IA de IA indétectable dans le cadre de votre processus d'évaluation.