La question revient partout : chez les professeurs qui corrigent des copies, chez les recruteurs qui lisent des lettres de motivation, chez les éditeurs de sites qui achètent des articles. Elle a une réponse, mais pas celle que vendent les outils payants.
La question n'est plus celle de 2023
Il y a trois ans, un texte produit par une machine se reconnaissait presque à l'oeil nu. Phrases de longueur régulière, transitions attendues, conclusions qui récapitulent. Les premiers détecteurs affichaient des taux de réussite élevés, et ils ne mentaient pas vraiment : le problème était facile.
Depuis, deux choses ont changé. Les modèles écrivent mieux, et surtout ils écrivent moins uniformément. Et l'usage a changé aussi : on demande de moins en moins à une IA d'écrire un texte de zéro, et de plus en plus de reformuler, corriger ou traduire un texte existant. Ces deux évolutions vont dans le même sens, et elles vont contre la détection.
Ce qu'un détecteur regarde réellement
Aucun détecteur ne comprend le texte qu'on lui soumet. Tous mesurent la même chose : la prévisibilité. Un modèle de langue attribue à chaque mot une probabilité compte tenu des mots qui précèdent, et un texte produit par une machine est en moyenne plus prévisible qu'un texte humain.
Cette idée, prise seule, ne marche plus. Un texte humain technique, administratif ou scolaire est prévisible lui aussi, et se fait accuser à tort. C'est d'ailleurs le reproche le plus fréquent adressé aux détecteurs : ils sanctionnent l'écriture simple, celle des élèves et des personnes dont le français n'est pas la langue maternelle.
Nous utilisons une méthode publiée en 2024 sous le nom de Binoculars, qui corrige en partie ce défaut. Elle fait lire le texte par deux modèles de la même famille et compare leurs réactions plutôt que de regarder la prévisibilité brute. Un passage difficile surprend les deux modèles de la même façon, et le rapport reste stable. Ce qui subsiste est la régularité propre à la machine. La page méthode détaille le calcul.
Ce que nous avons mesuré
Un détecteur ne vaut que par la mesure qui l'accompagne. Voici la nôtre.
D'un côté, 1800 textes français écrits par des humains avant 2022, donc avant que la rédaction assistée ne se répande. Ils sont répartis en six genres de 300 textes chacun : encyclopédie, discussion, pédagogie, vulgarisation, voyage, actualité. Le genre vulgarisation a été inclus exprès, parce que c'est celui que les détecteurs accusent le plus volontiers à tort.
De l'autre, 554 textes produits par quatre modèles : Mistral Small, GPT-4.1-mini, GPT-5.6 et GPT-6. Chacun porte sur le même sujet et vise la même longueur qu'un texte humain du corpus. Cet appariement compte plus qu'il n'y paraît : sans lui, un détecteur apprend à reconnaître des sujets plutôt que des machines, et les chiffres deviennent flatteurs et faux.
Le seuil a été réglé au plus prudent : celui qui laisse passer moins de 0,1 % de fausses alertes. Sur les 1800 textes humains, deux ont été signalés à tort.
Nous avons aussi vérifié notre propre code, parce qu'un calcul faux produit des chiffres parfaitement crédibles. Tout a été mesuré deux fois, avec deux programmes écrits indépendamment, l'un sur carte graphique, l'autre sur processeur. Sur les mêmes textes, la corrélation entre les deux séries de scores est de 0,9995, et les résultats finaux coïncident. Le seuil publié est celui du second programme, celui qui tourne réellement sur nos serveurs. Calibrer un chemin de calcul et en déployer un autre reviendrait à annoncer un taux d'erreur qui n'est pas celui que vous obtenez.
Le résultat, sans arrangement
| Modèle ayant écrit le texte | Textes | Retrouvés |
|---|---|---|
| GPT-4.1-mini | 160 | 65,0 % |
| Mistral Small | 160 | 55,0 % |
| GPT-5.6 | 174 | 0,6 % |
| GPT-6 | 60 | 0,0 % |
Lisez les deux dernières lignes. Sur 174 textes écrits par un modèle de la génération précédente, un seul a été repéré. Sur 60 textes du modèle le plus récent, aucun.
Ce n'est pas un défaut de notre outil, c'est l'état de l'art. La détection statistique repose sur un écart de régularité entre l'écriture humaine et l'écriture machine, et cet écart se referme à chaque génération. Il n'y a pas de réglage à trouver : la matière à mesurer disparaît.
Le mur de la reformulation
| Manière de produire le texte | Textes | Retrouvés |
|---|---|---|
| Traduit depuis l'anglais | 139 | 51,8 % |
| Rédigé directement | 138 | 49,3 % |
| Rédigé avec consigne de style humain | 138 | 38,4 % |
| Texte humain réécrit par l'IA | 139 | 0,0 % |
La dernière ligne mérite qu'on s'y arrête. Quand une IA reformule un texte écrit par une personne, le résultat garde la structure, le rythme et les choix de l'auteur d'origine. Il n'y a presque plus rien à mesurer.
Autrement dit, demander une reformulation suffit à passer notre outil. Et tous les autres, puisqu'ils reposent sur le même principe. Or c'est exactement l'usage qui se répand : on écrit un brouillon, on le fait retravailler. Le cas que la détection ne sait pas traiter est en train de devenir le cas le plus courant.
La longueur compte aussi
Un dernier facteur pèse sur le résultat, et il est rarement mentionné : la quantité de texte disponible.
| Longueur du texte | Textes IA retrouvés |
|---|---|
| Moins de 200 mots | 30,4 % |
| 200 à 350 mots | 33,7 % |
| 350 à 600 mots | 35,8 % |
| Plus de 600 mots | 40,7 % |
L'écart n'est pas énorme, mais il va toujours dans le même sens. Une mesure statistique a besoin de matière, et un paragraphe de cinquante mots n'en fournit pas assez. C'est pourquoi nous refusons les textes de moins de 150 mots plutôt que de rendre un verdict que nous savons peu fiable. Méfiez-vous des outils qui acceptent d'analyser trois phrases et vous renvoient un pourcentage : ce pourcentage est décoratif.
Ce que valent une alerte et un silence
Ces chiffres ont une conséquence pratique que peu de gens formulent correctement, et qui est le coeur du sujet.
Prenez cent copies, dont vingt écrites avec une IA de 2024 ou 2025. Notre outil en signalera environ sept. Comme il se trompe sur un texte humain toutes les neuf cents copies, ces sept alertes seront presque toutes justes. Une alerte vaut quelque chose.
Mais treize copies écrites par une machine passeront sans être signalées. Et si les mêmes copies avaient été écrites avec un modèle de 2026, il n'y aurait probablement eu aucune alerte du tout. Un silence ne vaut rien.
Cette asymétrie est ce qu'il faut retenir. Elle interdit de se servir d'un détecteur comme d'une preuve à charge dans un sens comme dans l'autre : ni pour accuser quelqu'un sur une alerte isolée, ni pour certifier qu'un texte est humain parce que rien n'a été signalé.
Pourquoi ces chiffres ne sont publiés nulle part
Allez voir les sites des détecteurs payants. Vous y trouverez des taux de réussite spectaculaires, parfois au-dessus de 99 %. Vous n'y trouverez presque jamais deux informations pourtant indispensables : le taux de fausses alertes, et le détail par modèle générateur.
L'absence du premier permet d'afficher un taux de détection élevé sans dire à quel prix. Un détecteur qui signale un texte sur deux au hasard attrape la moitié des textes IA, et accuse la moitié des auteurs humains. Sans le taux de fausses alertes, le taux de détection ne veut rien dire.
L'absence du second permet de ne pas montrer l'effondrement générationnel. Un outil mesuré sur des textes de 2023 affiche des chiffres très présentables, et rien n'oblige son éditeur à préciser sur quoi la mesure a été faite.
Nous ne prétendons pas que ces outils soient tous malhonnêtes. Beaucoup mesurent vraiment quelque chose. Mais un chiffre sans protocole n'est pas un résultat, c'est un argument commercial.
Que faire, concrètement
Si vous êtes enseignant : une alerte est un motif pour ouvrir une conversation, jamais pour conclure. Demandez à l'élève d'expliquer sa démarche, de commenter un passage, de citer ses sources. Cela reste infiniment plus fiable que n'importe quel score.
Si vous recrutez : traitez le résultat comme un signal faible parmi d'autres. Une lettre de motivation produite par une IA n'est d'ailleurs plus vraiment une anomalie.
Si vous éditez un site : le problème n'est pas l'origine du texte mais sa valeur. Un article exact, vérifié et utile ne devient pas mauvais parce qu'une machine a aidé à l'écrire, et un article creux ne devient pas bon parce qu'un humain l'a tapé.
Et l'année prochaine
Nos chiffres datent de septembre 2026 et ils se dégraderont. Chaque génération de modèles rapproche l'écriture machine de l'écriture humaine, et la détection statistique perd du terrain à chaque fois.
Nous remesurerons, et nous republierons ici, y compris si les résultats empirent. C'est la seule façon de rendre un chiffre utile : dire quand il a été obtenu, sur quoi, et accepter qu'il vieillisse.
