La
polémique autour du roman de Thélyson Orélien, C’était ça ou mourir (Montréal-Paris,
Le Boréal-Grasset, 2026), a soulevé la question de
la fiabilité des détecteurs d’IA. J’ai fait une petite enquête en soumettant un
court texte, rédigé par moi, bien avant que n’éclate le scandale, avec les
seuls recours et secours de mon IN (Intelligence naturelle…) à 11 détecteurs
d’IA accessibles sur la Toile (Pangram, Grammarly, Quillbot, Scribbr, ZeroGPT,
TextDefend, Lucide.ai, Humanizeai, Copyleaks, Originality.ai, Detecting.ai). Même s’ils ne prétendent
à aucune vérité scientifique, les résultats me semblent suffisamment
intéressants pour être mis en ligne.
Comment
fonctionnent les détecteurs d’IA
Les
détecteurs d’IA s’appuient sur la notion de probabilité. Ils cherchent à
déterminer, à partir de modèles (patterns) linguistiques et de certains autres
critères, si un texte a probablement été rédigé par l’IA ou non. Deux
concepts sous-tendent leurs recherches : la prévisibilité et la variabilité.
La
prévisibilité (perplexity, ou prédictibilité) mesure à quel point
le choix des mots dans une phrase est inattendu ou, au contraire, prévisible
pour un algorithme. Pensez aux mots que votre portable vous propose quand vous
tapez un texte. Si le détecteur parvient presque toujours à deviner le mot
exact que vous avez écrit, la « perplexité » est très faible. Une
perplexité faible indique que le texte suit une logique statistique parfaite.
Le détecteur en conclut qu'il s'agit d'une IA.
La
variabilité (burstiness, ou irrégularité ou chaos)
concerne le rythme du texte. Elle analyse la structure globale du texte en
mesurant les variations de longueur et de construction entre les phrases. Les humains
écrivent de manière irrégulière, mélangeant des phrases longues et complexes à d'autres,
simples et courtes. Les IA tendent à produire des phrases d’une longueur très
constante, au rythme ultra-régulier et monotone. Si toutes les phrases ont une
structure similaire et une longueur uniforme, le détecteur considère que le
texte manque de « chaos humain » et le classe comme « généré par
une IA ».
Le
piège avec les textes classiques
Les
défenseurs d’Orélien insistent sur ce qu’ils jugent être la « non-fiabilité »
des détecteurs d’IA, en rappelant que des textes de Shakespeare, de Victor Hugo
ou de la Bible, donc rédigés bien avant l’apparition de l’IA, ont été
diagnostiqués « générés par l’IA ». Cette critique n’est pas
rédhibitoire. En effet, ces textes utilisent des tournures de phrase très
codifiées et rituelles ou des structures grammaticales parfaites. De plus,
comme les IA ont été « entraînées » sur ces textes, les détecteurs
les « connaissent » par cœur. La perplexité y est donc quasi nulle,
ce qui trompe le logiciel.
L’équipe
du détecteur d’IA français Lucide.ai a montré les limites de ces concepts et
proposé d’autres méthodes prometteuses. Voir, par exemple, https://lucide.ai/fonctionnement-detecteur-ia/.
Mais cela n’a pas empêché Lucide.ai de se tromper sur un de mes tests.
Texte
T1 (entièrement rédigé par moi)
(§1)
Le français se meurt, et tout le monde regarde ailleurs. Dans l’indifférence
quasi générale, voire dans le déni, notre langue subit la pression de plus en
plus forte de l’anglais non seulement sur son vocabulaire et sa grammaire, mais
aussi jusque dans son emploi.
(§2)
Les Linguistes atterrées, un collectif d’universitaires,
s’autoproclamant « scientifiques du langage », prétend, en dépit de
tous les indicateurs, que « le français va très bien », qu’« il
n’est pas envahi par l’anglais », que la notion de « franglais »
« n’a pas d’assise scientifique », que l’anglais, certes « très
visible dans l’espace public », ne sert qu’à « retenir
l’attention » (sic), sans fournir aucune étude scientifique à
l’appui. « Bien sûr [reconnaissent-ils], l’anglais aujourd’hui est LA
langue dominante à l’échelle planétaire », mais cela ne les inquiète pas
outre mesure : autrefois, c’était le latin qui dominait, cela a même été
l’italien ; aujourd’hui, c’est l’anglais. Circulez, il n’y a rien à voir.
Tout va très bien, Madame la marquise…
(§3)
En réalité, le français subit une profonde mutation, un processus, non pas de
créolisation, comme l’affirme erronément Jean-Luc Mélenchon, mais de métissage,
pour continuer dans les métaphores anthropomorphiques. Et ce métissage se fait
non pas avec l’espagnol ou l’arabe, mais avec l’anglais. En linguistique, on
qualifie ce phénomène d’hybridation. Le français se transforme sous nos yeux et
dans nos oreilles en une langue hybride anglais-français. Désormais, il est
devenu difficile de parler en français de la vie d’aujourd’hui sans recourir à
des anglicismes. (3 paragraphes, 252 mots).
Recherches
de présence d’IA
Comment
fonctionne cette recherche ?
Un
exemple de procédure de détection : celle
de TextDefend (traduit de l’anglais)
|
·
Recherche de texte
généré par l’IA
·
Vérification du
style
·
Vérification des
schémas linguistiques anormaux
·
Évaluation de la
variété du texte
·
Analyse de la
cohérence
·
Préparation du
rapport
|
Un
exemple d’analyse de texte : celle
d’Humanizeai-pro
Le
détecteur d’IA Humanizeai-pro a fourni un rapport expliquant pourquoi, selon
lui, le texte T1 a été rédigé à 100 % par un être humain. Pour ne pas allonger mon développement,
je n’ai pas reproduit les exemples tirés de T1 sur lesquels s’appuie le
détecteur sous chacun de ces points. C’est moi qui souligne.
|
·
Longueur moyenne des
phrases et présence de phrases de longueur variée :
les humains maintiennent une diversité de longueurs, avec des phrases courtes
et percutantes qui alternent avec des phrases plus longues, ce qui est
cohérent avec un écrit humain plutôt qu’un texte généré par IA.
·
Usage fréquent de
mots grammaticaux et de connecteurs :
le texte montre une distribution élevée de mots outils et de connecteurs,
caractéristiques d’un style humain qui organise logiquement les idées et
assure la fluidité du discours.
·
Vocabulaire
accessible et mots courts en moyenne :
l’emploi de termes simples et généralement courts est typique de l’expression
humaine, contrairement à l’usage systématiquement sophistiqué ou élaboré
parfois observé dans les textes IA.
·
Reformulations
perceptibles : la présence de
reformulations et de reprises de thèmes […] est une caractéristique humaine,
renforçant l’argumentation par réitération.
·
Présence d’indices
narratifs et de phrasés naturels : les
tournures et l’extension des phrases, y compris les guillemets et le style
descriptif, reflètent une narration humaine plutôt qu’un texte généré par IA.
·
Taux élevé de mots
outils (mots grammaticaux) dans le texte,
cohérent avec l’expression humaine qui privilégie la cohérence et la
fluidité
·
Répétition plus
fréquente d’expressions ou de groupes de mots,
phénomène courant dans l’écriture humaine pour renforcer le propos
·
Rythme et burstiness
visibles : présence d’alternances
marquées entre phrases courtes et longues, ce qui produit un rythme discursif
typique de l’écriture humaine et moins fréquent dans les textes générés par
IA
|
Résultats
Test
n°1
Tableau
n°1
|
Détecteurs
|
Texte
|
§§
|
Auteur
réel
|
Diagnostics
des détecteurs
|
Commentaires
des détecteurs
|
|
|
T1
|
1-3
|
100%
humain
|
humain
|
IA
|
|
|
Pangram
|
|
|
|
100%
|
0%
|
We believe that this entire text
is human written.
|
|
Grammarly
|
|
|
|
100%
|
0%
|
0% of this text appears to be
AI-generated.
|
|
Quillbot
|
|
|
|
100%
|
0%
|
0%
du texte est probablement généré par l’IA.
Caution: Our AI Detector is
advanced, but no detectors are 100% reliable, no matter what their accuracy
scores claim. Never use AI detection alone to make decisions that could
impact a person's career or academic standing.
|
|
Scribbr
|
|
|
|
100%
|
0%
|
0%
du texte est probablement généré par l’IA.
|
|
TextDefend
|
|
|
|
31%
|
69%
|
69%
du texte généré par l’IA (détail : 49% par IA, 20% mixte) 31% rédigé par
un humain.
|
Quatre
détecteurs d’IA (Pangram, Grammarly, Quillbot et Scribbr) sur cinq ont
diagnostiqué que ce texte a été écrit à 100% par un humain, ce qui correspond à
la réalité.
En
revanche, TextDefend a diagnostiqué 69% de texte produit par l’IA (dans le
détail : 49% d’IA et 20% de texte mixte) et seulement 31% par un humain.
Même
texte. Résultats divergents. Cela signifie que ce sont les algorithmes des
détecteurs qui sont en cause. Ceux qui ne voient pas de traces d’IA seraient-ils
défaillants dans cette recherche ? Ce n’est pas possible puisque leur
diagnostic est correct. Celui qui en voit le ferait-il à tort ?
Contre-épreuve
Test
n°2
Pour
vérifier les qualités de détection des détecteurs d’IA, j’ai repris le même
texte T1, mais en supprimant les deux premiers paragraphes (rédigés par moi) pour
les remplacer par des paragraphes (surlignés en jaune) réécrits par l’IA
Jenni.ai (aide à la recherche et à la rédaction). Les paragraphes 1, 2 et 3 de
T2 sont une interprétation et un développement par l’IA du paragraphe 1 de T1.
Texte
T2
(§1) La langue française contemporaine
traverse une phase de mutation accélérée, marquée par une omniprésence des
anglicismes propulsée par les technologies numériques et la mondialisation.
(§2) Cette imprégnation linguistique
dépasse désormais le simple lexique pour s’immiscer dans les structures
syntaxiques et les usages grammaticaux du français, transformant durablement
les discours médiatiques.
(§3) Face à ce phénomène, le débat
académique oscille entre une vision alarmiste, qui y perçoit une menace pour
l’intégrité linguistique, et une approche plus nuancée voyant dans ces emprunts
un vecteur d’enrichissement néologique.
(§4)
Les Linguistes atterrées, un collectif d’universitaires,
s’autoproclamant « scientifiques du langage », prétend, en dépit de
tous les indicateurs, que « le français va très bien », qu’« il
n’est pas envahi par l’anglais », que la notion de « franglais »
« n’a pas d’assise scientifique », que l’anglais, certes « très
visible dans l’espace public », ne sert qu’à « retenir
l’attention » (sic), sans fournir aucune étude scientifique à
l’appui. « Bien sûr [reconnaissent-ils], l’anglais aujourd’hui est LA
langue dominante à l’échelle planétaire », mais cela ne les inquiète pas
outre mesure : autrefois, c’était le latin qui dominait, cela a même été
l’italien ; aujourd’hui, c’est l’anglais. Circulez, il n’y a rien à voir. Tout
va très bien, Madame la marquise…
(§5)
En réalité, le français subit une profonde mutation, un processus, non pas de
créolisation, comme l’affirme erronément Jean-Luc Mélenchon, mais de métissage,
pour continuer dans les métaphores anthropomorphiques. Et ce métissage se fait
non pas avec l’espagnol ou l’arabe, mais avec l’anglais. En linguistique, on
qualifie ce phénomène d’hybridation. Le français se transforme sous nos yeux et
dans nos oreilles en une langue hybride anglais-français. Désormais, il est
devenu difficile de parler en français de la vie d’aujourd’hui sans accumuler
les anglicismes. (5 paragraphes, 289 mots).
Résultats
du test n°2
Tableau
n°2
|
Détecteurs
|
Texte
|
§§
|
Auteurs
réels
|
Diagnostics
des détecteurs
|
Commentaires
des détecteurs
|
|
|
T
2
|
§
1-5
|
humain :
72%
IA :
28%
|
humain
|
IA
|
|
|
Pangram
|
|
|
|
68%
|
32%
|
We believe that this text is a mix
of AI and human-written content.
AI-generated of the document
appears in the earlier part. AI: 85 words, HW: 221 words.
|
|
Grammarly
|
|
|
|
69%
|
31%
|
31% of this text appears to be
AI-generated.
|
|
Quillbot
|
|
|
|
100%
|
0%
|
Généré
par l’IA : 0%
Écrit
par un humain : 100%
|
|
Scribbr
|
|
|
|
100%
|
0%
|
|
|
TextDefend
|
|
|
|
16%
|
84%
|
84%
du texte généré par l’IA (détails : 67% IA, 17% mixte), 16% rédigé par
un humain
|
Deux
détecteurs (Pangram et Grammarly) ont correctement identifié T2 comme un texte mixte :
une partie d’origine humaine (selon eux, respectivement 68% et 69%) et une
autre produite par l’IA (32% et 31%) et ce, dans des pourcentages très proches
de la réalité (72% de texte « humain », 28% de texte « IA »).
Quatre
détecteurs (Quillbot, mais aussi ZeroGPT, Lucide.ai et Humanizeai.com) n’y ont
vu que du feu, considérant que T2 avait été écrit à 100% par un humain, alors
qu’en réalité il l’a été en partie par une IA (Jenni.ai).
Detecting
donne des renseignements intéressants : Le §1 est jugé IA à 70% ; le
§2, IA à 64%. Ce sont les deux paragraphes réécrits par Jenni.ai. Mais il juge
aussi comme étant écrit par IA des passages de mon texte personnel, à
savoir : « sans fournir aucune étude scientifique à l’appui »
(61%) ; « circulez, il n’y a rien à voir » (70%) ;
« Tout va très bien, Madame la marquise » (63%) ; « En
réalité […] anthropomorphique » (63%) ; « Et ce métissage […]
anglais » (68%) ; « En linguistique […] anglais-français »
(68%) ; « Désormais […] anglicismes » (67%).
Il
s’agit d’expressions toutes faites fréquentes sur le Net (« circulez, il
n’y a rien à voir », « tout va très bien, Madame la marquise »)
ou de formulations fréquentes dans les publications (« sans fournir aucune
étude ») ou reprises sur le web.
Résultats
du test n°3
Paragraphes
testés (rédigés par Jenni.ai) : 1 à 3
La langue française contemporaine
traverse une phase de mutation accélérée, marquée par une omniprésence des
anglicismes propulsée par les technologies numériques et la mondialisation.
Cette imprégnation linguistique dépasse
désormais le simple lexique pour s’immiscer dans les structures syntaxiques et
les usages grammaticaux du français, transformant durablement les discours
médiatiques.
Face à ce phénomène, le débat
académique oscille entre une vision alarmiste, qui y perçoit une menace pour
l’intégrité linguistique, et une approche plus nuancée voyant dans ces emprunts
un vecteur d’enrichissement néologique. (82 mots, 28%
de T2).
Tableau
n°3
|
Détecteurs
|
Texte
|
§§
|
Auteur
réel
|
Diagnostics
des détecteurs
|
Commentaires
des détecteurs
|
|
|
T
2
|
1-3
|
100%
IA (Jenni.ai)
|
humain
|
IA
|
|
|
Pangram
|
|
|
|
0%
|
100%
|
We believe that this entire text
is AI.
|
|
Grammarly
|
|
|
|
0%
|
100%
|
Resembles AI text: 100%.
No AI text patterns found: 0%.
|
|
Quillbot
|
|
|
|
0%
|
100%
|
100%
du texte est probablement généré par l’IA.
|
|
Scribbr
|
|
|
|
0%
|
100%
|
|
|
TextDefend
|
|
|
|
34%
|
66%
|
66%
du texte généré par l’IA (détail : 56% IA, 10% mixte), 34% rédigé par un
humain.
|
Il
y a quasi-unanimité dans les diagnostics concernant les paragraphes 1 à 3 de T2
et cette unanimité correspond à la réalité. Pangram, Grammarly, Quillbot et
ZeroGPT ont correctement analysé cette partie du texte. Mais TextDefend y a vu
une part de rédaction humaine. Ce qui n’est pas le cas : mon texte
original (1 paragraphe) a été réécrit et développé par Jenni.ai (3
paragraphes).
Résultats
du test n°4
Paragraphes
testés (rédigés par moi) : paragraphes 4 et 5
Les
Linguistes atterrées, un collectif d’universitaires, s’autoproclamant
« scientifiques du langage », prétend, en dépit de tous les
indicateurs, que « le français va très bien », qu’« il n’est pas
envahi par l’anglais », que la notion de « franglais »
« n’a pas d’assise scientifique », que l’anglais, certes « très
visible dans l’espace public », ne sert qu’à « retenir
l’attention » (sic), sans fournir aucune étude scientifique à
l’appui. « Bien sûr [reconnaissent-ils], l’anglais aujourd’hui est LA
langue dominante à l’échelle planétaire », mais cela ne les inquiète pas
outre mesure : autrefois, c’était le latin qui dominait, cela a même été
l’italien ; aujourd’hui, c’est l’anglais. Circulez, il n’y a rien à voir.
Tout va très bien, Madame la marquise…
En
réalité, le français subit une profonde mutation, un processus, non pas de
créolisation, comme l’affirme erronément Jean-Luc Mélenchon, mais de métissage,
pour continuer dans les métaphores anthropomorphiques. Et ce métissage se fait
non pas avec l’espagnol ou l’arabe, mais avec l’anglais. En linguistique, on
qualifie ce phénomène d’hybridation. Le français se transforme sous nos yeux et
dans nos oreilles en une langue hybride anglais-français. Désormais, il est
devenu difficile de parler en français de la vie d’aujourd’hui sans accumuler
les anglicismes. (207 mots, 72% de T2).
Tableau
n°4
|
Détecteurs
|
Texte
|
§§
|
Auteur
réel
|
Diagnostics
des détecteurs
|
Commentaires
des détecteurs
|
|
|
T
2
|
4-5
|
100%
humain
|
humain
|
IA
|
commentaires
|
|
Pangram
|
|
|
|
100%
|
0%
|
We believe that this entire text
is human-written.
|
|
Grammarly
|
|
|
|
100%
|
0%
|
Resembles AI text: 0%.
No AI text patterns found: 100%.
|
|
Quillbot
|
|
|
|
100%
|
0%
|
Généré
par l’IA : 0%.
Écrit
par un humain : 100%.
|
|
Scribbr
|
|
|
|
100%
|
0%
|
|
|
TextDefend
|
|
|
|
33%
|
67%
|
67%
du texte généré par l’IA (détail : 60% IA, 7% mixte), 33% rédigé par un
humain.
|
Pangram,
Grammarly et Quillbot donnent la réponse attendue. TextDefend (et ZeroGPT) se
démarquent. TextDefend se trompe quand il affirme que « 67% du texte a été
généré par IA ». ZeroGPT affirme correctement que ces paragraphes sont probablement
écrits par un humain, mais ajoute en même temps que 96,6% pourraient
l’avoir été par l’IA. C’est moi qui souligne. Comprenne qui pourra…
Écarts
au but…
Sur
5 détecteurs, 3 ont livré des diagnostics erronés. Cela demande explication.
Tableau
n°5
|
Détecteurs
d’IA
|
Texte
et paragraphes
|
Diagnostics
des détecteurs d’IA
|
Réalité
|
|
|
|
humain
|
IA
|
humain
|
IA
|
|
Quillbot
|
T2
§§ 1-5
|
100%
|
0%
|
72%
|
28%
|
|
Scribbr
|
T2
§§ 1-5
|
100%
|
0%
|
72%
|
28%
|
|
TextDefend
|
T1
§§ 1-3
|
31%
|
69%
|
100%
|
0%
|
|
TextDefend
|
T2
§§ 1-5
|
16%
|
84%
|
72%
|
28%
|
|
TextDefend
|
T2
§§ 1-3
|
34%
|
66%
|
0%
|
100%
|
|
TextDefend
|
T2
§§ 4-5
|
33%
|
67%
|
100%
|
0%
|
Quillbot
et Scribbr n’ont pas vu que les §§ 1-3 de T2 n’avaient pas été rédigés par un
humain, mais par une IA.
TextDefend
détecte la présence de l’IA dans T1 §§ 1-3 et dans T2 §§ 4-5, alors qu’il n’y
en a pas ; surévalue cette présence dans T2 §§ 1-5 ; la sous-évalue
dans T2 §§1-3.
Explications
possibles de ces divergences et de ces erreurs de diagnostic
Il
faut distinguer détecteur d’IA et détecteur de plagiat. Les détecteurs de
plagiat cherchent à déterminer si le texte analysé est un texte original ou
un texte copié. C’est facile à vérifier : il suffit de comparer un
texte antérieur à un texte postérieur et de relever les similitudes. Les détecteurs d’IA
cherchent à déterminer si le texte présenté a été écrit par un humain ou par
une IA.
Pourquoi
Quillbot et Scribbr n’ont pas diagnostiqué la présence d’IA dans T2 §§ 1-5,
alors qu’il y en a à hauteur de 28% ? Ce sont des cas de faux négatifs.
Pourquoi
TextDefend a diagnostiqué la présence d’IA dans T1 §§ 1-3 et T2 §§ 4-5, alors
qu’il n’y en a pas ? C’est un cas de faux positif. Pourquoi a-t-il
surestimé le pourcentage d’IA dans T2 §§ 1-5 et l’a-t-il sous-estimé dans T2 §§
1-3 ?
Là
où intervient ChatGPT
Pour
en avoir le cœur net, j’ai une longue conversation avec ChatGPT, l’agent
conversationnel (chatbot) d’IA bien connu. Il souligne que les
détecteurs d’IA peuvent être instables et dépendants de leur modèle de langue.
La perplexité, par exemple, mesure à quel point la succession des mots dans le
texte est prévisible. Une prose très conventionnelle, bien structurée, peut
ressembler statistiquement à de la prose produite par une IA, même si elle est
entièrement humaine.
Dans
T1 (dont je suis le seul auteur), plusieurs éléments sont susceptibles d’être
considérés comme produits par une IA (je cite ChatGPT) : une syntaxe
relativement élaborée ; beaucoup de phrases longues ; un registre soutenu et
argumentatif ; des formulations très structurées ; des répétitions
rhétoriques ; des constructions parallèles ; des termes relativement
prévisibles dans un texte argumentatif : en réalité, processus, phénomène,
linguistique, hybridation, se transforme, etc. ; des
citations et des incises ; une forte cohérence thématique.
Mais
d’autres éléments sont susceptibles d’être jugés comme écrits par un humain
(toujours selon ChatGPT) : des ruptures de registre ; de
l'ironie ; des parenthèses discursives ; des prises de position
rhétoriques ; des choix lexicaux assez personnels.
Un
détecteur donnant davantage de poids à l'irrégularité, à la diversité lexicale
ou à des caractéristiques stylistiques inhabituelles peut interpréter ces
éléments comme des indices favorables à une rédaction humaine. Un autre
détecteur peut, au contraire, considérer que la structure générale du texte
correspond suffisamment à son corpus d'entraînement pour lui attribuer un
score IA élevé. Les détecteurs ne mesurent donc pas tous la même chose.
De
plus, la méthodologie de la plupart des détecteurs d’IA s’appuie sur l’analyse
de milliards de textes anglais. Entre les corpus anglais et le français, il
peut y avoir des caractéristiques différentes. Conclusion : on ne peut
juger les 69% de TextDefend sans connaître la méthodologie de ce détecteur d’IA…
Tableau
n°6 : Conséquences
de méthodologies différentes
|
Détecteurs
|
Méthodologies
|
Résultats
|
|
|
|
humain
|
IA
|
|
Pangram
|
A,
B, C
|
100%
|
0%
|
|
Grammarly
|
D,
E, F
|
100%
|
0%
|
|
Quillbot
|
G,
H, I
|
100%
|
0%
|
|
Scribbr
|
J,
K, L
|
100%
|
0%
|
|
TextDefend
|
M, N, O
|
31%
|
69%
|
Source :
ChatGPT
L’origine
du texte T1 est connue : elle est humaine à 100%. Or, si 4 détecteurs (Pangram,
Grammarly, Quillbot et Scribbr) livrent le bon diagnostic, le cinquième,
TextDefend considère qu’elle est à 69% IA. Cela ne signifie pas que les 4 détecteurs
se trompent et que le texte contient effectivement des éléments d’IA. Cela
signifie plutôt que TextDefend produit un taux de faux positif non nul. Autrement
dit, les caractéristiques statistiques de T1 ressemblent, selon le modèle de
TextDefend, à celles de certains textes que son système associe à l'IA.
Pour
arriver à cette conclusion, ChatGPT a analysé T1 phrase par phrase, en montrant chaque fois ce
qui peut avoir trompé TextDefend. Sa constatation : « Plus un humain
écrit de manière propre, régulière, grammaticalement maîtrisée et
conventionnelle, plus certains détecteurs peuvent avoir du mal à distinguer
cette prose de celle d'un LLM. »
Tous
les détecteurs d’IA préviennent qu’ils peuvent se tromper et qu’il faut être
très prudent avant de prendre des décisions sur la base de leurs diagnostics. Ma
petite enquête le confirme, qui révèle des résultats divergents pour un même
texte selon les détecteurs d’IA, des variations de diagnostics dans le temps par
un même détecteur, l’existence de faux positifs et de faux négatifs, etc. Cela
ne veut pas dire qu’il faut tout rejeter. Mais je reste… perplexe.
Mots-clés : Intelligence artificielle, IA, fiabilité, test, Pangram, TextDefend.