Analyse d'un PDF

Détecter l'IA dans un PDF

Mémoire, rapport de stage, copie rendue en PDF : déposez le fichier, nous en extrayons le texte directement dans votre navigateur, vous le relisez, puis vous lancez l'analyse.

0 mot

Comment se passe l'analyse d'un PDF

Un PDF n'est pas un texte, c'est une description de page : des morceaux de mots posés à des coordonnées précises, dans des polices embarquées. Pour en retrouver le texte, il faut le reconstituer ligne par ligne. Nous le faisons avec PDF.js, la bibliothèque qui affiche les PDF dans Firefox, exécutée dans votre navigateur. Le fichier lui-même n'est jamais envoyé sur notre serveur.

Le texte obtenu s'affiche dans la zone ci-dessus. Nous retirons au passage les lignes qui se répètent sur la plupart des pages, comme les en-têtes, les pieds de page et les numéros, et nous recollons les mots coupés en fin de ligne. Vous pouvez ensuite relire et corriger ce texte. C'est lui, et lui seul, qui part à l'analyse, exactement comme si vous l'aviez collé sur la page d'accueil.

Ce qu'il vaut mieux retirer avant d'analyser

Notre détecteur mesure la régularité d'une prose. Tout ce qui n'est pas de la prose rédigée brouille la mesure :

  • la page de garde, le sommaire et les remerciements, faits de lignes courtes et de formules convenues ;
  • la bibliographie, les annexes et les tableaux, dont les suites de chiffres et de références n'ont rien d'un texte ;
  • les citations longues, qui ne sont pas de l'auteur du document ;
  • les passages dans une autre langue que le français, pour lesquels notre seuil n'a pas été mesuré.

L'outil analyse le texte par tranches d'environ 380 mots. Pour un long document, commencez par l'introduction ou par une partie dont vous doutez, plutôt que par la première page.

Un document long multiplie les fausses alertes

Chaque tranche analysée garde notre taux de fausse alerte, inférieur à 0,5 %. Mais plus vous analysez de tranches, plus il devient probable qu'une seule soit signalée à tort. Un mémoire de cinquante pages découpé en trente tranches n'est pas trente fois plus sûr, il est trente fois plus exposé à une alerte isolée. Une tranche signalée au milieu de vingt tranches silencieuses mérite une relecture, pas une conclusion.

Les informations du fichier

Après l'extraction, nous affichons les métadonnées du PDF quand elles existent : le logiciel qui l'a créé, celui qui l'a converti, les dates de création et de modification. Ces informations décrivent la fabrication du fichier, pas celle du texte. Un texte rédigé par une IA puis collé dans un traitement de texte donnera simplement le nom de ce traitement de texte. Elles peuvent en revanche éclairer une incohérence, par exemple une date de création postérieure à la date de remise annoncée.

Les PDF que nous ne savons pas lire

Un PDF scanné, ou produit en photographiant des pages, ne contient que des images. Sans reconnaissance de caractères, il n'y a aucun texte à extraire, et nous vous le signalons. Les PDF protégés par un mot de passe ne peuvent pas non plus être ouverts. Pour un document en Word ou en OpenDocument, le plus simple est de copier son texte et de le coller sur la page d'accueil.

Enseignants : que faire face à une copie suspecte

Lire la méthode complète et les chiffres détaillés