Jean-Luc Durand

Peut-on encore écrire sans la machine ?

Une polémique est en cours, une de plus me direz-vous, sur l'usage de l'intelligence artificielle. Un écrivain québécois, Thélyson Orélien, est accusé d'avoir fait écrire par elle son dernier roman. C'est la conclusion donnée par Pangram, un logiciel spécialisé dans l'analyse sémantique et qui permet, d'après ses auteurs, de détecter l'écriture d'origine non humaine.

J'ai donc eu l'idée de faire analyser un de mes propres textes par ce logiciel. C'est très facile car il propose un essai gratuit, sans même devoir créer un compte. Je lui ai tout bonnement soumis mon dernier article , publié il y a 5 jours à peine, Le cerveau d'une mouche, lequel d'ailleurs parle aussi d'IA !

Et le résultat m'a un peu gêné. Le score du logiciel est de 96% écrit par un être humain et 4% d'origine artificielle. Pourtant la totalité du texte est bien de moi. Je n'utilise jamais l'IA pour rédiger, mais pour la documentation et la relecture, notamment les fautes de grammaire et d'orthographe. C'est d'ailleurs précisé dans le pied de page de ce site. Mais alors, que se passe-t-il ? Pangram2 Là où Pangram est intéressant, c'est qu'il indique clairement les passages qui ne lui paraissent pas naturels. On le voit sur la copie d'écran : ce qui est d'origine humaine est surligné en vert et l'artificiel en orange. Voici les lignes en cause.

Il en aura juste l'apparence, un peu comme aujourd'hui ChatGPT ou Claude semblent "comprendre" ce que vous leur dites, alors qu'ils ne font que des probabilités. Bref, de longs débats en perspective. Tout ça à cause d'une mouche.

Ne comprenant pas exactement ce qui pose problème, j'ai posé la question à... une autre IA (encore une !), Gemini de Google. Je vous donne sa réponse détaillée.

Les détecteurs de texte synthétique comme Pangram ne « comprennent » pas le fond ; ils évaluent des métriques statistiques sur les suites de mots, principalement la perplexité (le degré de surprise d'un mot par rapport aux précédents) et l'éclatement (la variation de rythme et de longueur des phrases).

Si un passage a une perplexité très basse, c'est-à-dire qu'il enchaîne des séquences de mots très probables et très fréquentes dans les données d'entraînement des LLM, l'algorithme le classe immédiatement comme généré par une machine.

Dans vos deux phrases finales, plusieurs éléments déclenchent typiquement ce comportement.

  1. La comparaison explicite avec les LLM « [...] un peu comme aujourd'hui ChatGPT ou Claude semblent "comprendre" ce que vous leur dites, alors qu'ils ne font que des probabilités. »

    Cette formulation réunit deux signaux majeurs pour un classifieur :

  1. Le schéma de conclusion scolaire « Bref, de longs débats en perspective. Tout ça à cause d'une mouche. »

    Les modèles de langage ont une tendance structurelle très forte à terminer leurs réponses par une synthèse courte introduite par un mot de liaison conclusif :

  1. L'absence de « rupture » statistique Le reste de votre article contient des marques humaines évidentes : de l'agacement subjectif (« Je déteste les mouches. Elles m'ennuient profondément. »), des ruptures de ton et de l'ironie (« On est contents de savoir que... »).

    En revanche, sur ces trois dernières lignes, le ton devient subitement plus didactique, très régulier et parfaitement prévisible d'un point de vue probabiliste. C'est ce contraste local avec le reste du billet qui fait franchir le seuil d'alerte à l'outil.

Je comprends l'explication, mais le problème est que certains signaux qui déclenchent l'alerte chez Pangram relèvent de mon propre style. J'aime bien l'usage du terme « bref », par exemple. Il permet d'introduire facilement une conclusion.

Du coup est-ce que l'on va devoir éviter certaines formules, certains effets de style, juste pour ne pas susciter des doutes sur son travail ?

Par exemple certains disent que l'usage du tiret quadratin (—) dénoterait à coup sûr le recours à l'IA. Eh bien, ceux-là n'ont pas dû lire beaucoup de littérature française. Car ce tiret y est fréquent, notamment pour marquer un dialogue ou remplacer des parenthèses. Il est encore plus utilisé en littérature anglophone. Je l'emploie régulièrement dans les textes de mon blog sur l'écriture. Il est fort possible que les IA en abusent, mais cela ne doit en rien constituer une preuve.

Quelle que soit la méthode de détection, dans le cas précis de Thélyson Orélien, le logiciel a très certainement raison. Le score frôle les 100% d'origine artificielle. De surcroît on découvre que, dans le passé, l'intéressé a plagié de nombreux textes, jusqu'à dégoûter même ses plus fervents soutiens.

Autrement dit, je pense qu'il faut utiliser ces logiciels de détection avec mesure. Si un livre entier, soit plusieurs dizaines de pages, est taxé 100% IA, alors il n'y a pas de doute à avoir. Mais si un texte court, de quelques milliers de mots, montre quelques tournures douteuses, alors restons prudents avant de lancer des accusations.

Cela dit, inévitablement, la question va se poser très souvent dans l'avenir, car l'IA est partout, au point qu'il est presque difficile de s'en passer. En matière d'écriture, on voit de plus en plus d'outils qui l'utilisent, même lorsqu'on n'a rien demandé.

Par exemple j'écris ce texte avec un logiciel appelé iWriter Pro pour Mac. C'est un banal traitement de texte conçu pour être très simple et favoriser la concentration. Après avoir tapé quelques mots, j'ai, par prudence, sauvegardé le fichier. Je vois alors apparaître un nom proposé en anglais : « IA Writing Controversy ». Le logiciel semble donc comprendre le français mais me propose un nom en anglais, ce qui n'est pas très logique. Mais surtout, cette aide a un effet néfaste car elle tend à infantiliser. Au lieu de réfléchir au nom à donner à mon fichier, je n'ai qu'à cliquer sur « Save ». Plus aucun effort intellectuel n'est nécessaire, même pour ce petit détail.

Alors que faire ? Il pourrait y avoir une solution radicale. Pourquoi ne pas considérer, tout simplement, que l'IA fait maintenant partie des outils de l'écrivain ? Et que seul compte le résultat ?

Facile à dire, mais en pratique cela implique un changement complet de mentalité. Cela remettrait en cause la relation entre le lecteur et l'auteur, qui est basée sur la confiance. Si celui qui signe un livre n'est pas celui qui l'écrit, à quoi sert la signature ?

D'ailleurs, le phénomène des nègres littéraires n'a jamais été facilement accepté. Certains auteurs à succès, comme Paul-Loup Sulitzer, ont fait appel aux services de quelqu'un d'autre pour écrire leurs ouvrages, et cela a toujours déclenché des polémiques. Rien d'étonnant à ce qu'il en soit de même avec l'IA.

En attendant une réflexion sur la question, on observe qu'aujourd'hui les utilisateurs commencent à se protéger. Il existe maintenant des logiciels dits humanizers qui permettent de réécrire un texte en supprimant les tics et usages de l'intelligence artificielle. Les principaux clients sont les étudiants qui recourent massivement à ChatGPT ou Claude pour rédiger leurs dissertations ou mémoirs.

Une sorte de combat de logiciels contre d'autres logiciels. Est-ce que c'est cela que va devenir la littérature, un champ de bataille informatique ?

#IA