The China Mail - L'intoxication des données, la menace invisible qui cible les chatbots IA

USD -
AED 3.6725
AFN 65.494926
ALL 80.679645
AMD 366.288928
ANG 1.790245
AOA 917.000305
ARS 1492.537002
AUD 1.418188
AWG 1.8
AZN 1.698444
BAM 1.696374
BBD 2.01504
BDT 123.207827
BGN 1.697507
BHD 0.377301
BIF 2991.001149
BMD 1
BND 1.280135
BOB 11.800369
BRL 5.1966
BSD 1.000494
BTN 95.325328
BWP 13.468235
BYN 2.988078
BYR 19600
BZD 2.012178
CAD 1.394825
CDF 2274.99961
CHF 0.813895
CLF 0.023232
CLP 914.349805
CNY 6.74385
CNH 6.745085
COP 3148.57
CRC 454.496173
CUC 1
CUP 26.5
CVE 95.636864
CZK 21.031971
DJF 178.163462
DKK 6.487855
DOP 58.416636
DZD 132.893258
EGP 50.216102
ERN 15
ETB 161.833944
EUR 0.86782
FJD 2.214894
FKP 0.740048
GBP 0.741345
GEL 2.610349
GGP 0.740048
GHS 11.455112
GIP 0.740048
GMD 73.999534
GNF 8788.949845
GTQ 7.633694
GYD 209.352652
HKD 7.846805
HNL 26.817009
HRK 6.539301
HTG 130.869412
HUF 316.202001
IDR 17877.15
ILS 2.979102
IMP 0.740048
INR 95.404501
IQD 1310.654981
IRR 1374625.000108
ISK 123.220341
JEP 0.740048
JMD 158.387073
JOD 0.708992
JPY 159.441503
KES 129.259499
KGS 87.449986
KHR 4051.504677
KMF 427.999534
KPW 900.000031
KRW 1415.905008
KWD 0.30919
KYD 0.833785
KZT 465.845863
LAK 22573.692359
LBP 89594.462731
LKR 334.433424
LRD 181.588728
LSL 16.166066
LTL 2.95274
LVL 0.60489
LYD 6.381133
MAD 9.293065
MDL 17.343863
MGA 4305.533269
MKD 53.364038
MMK 2099.936813
MNT 3596.665371
MOP 8.086666
MRU 39.989592
MUR 47.330354
MVR 15.460516
MWK 1734.876641
MXN 17.05955
MYR 4.088302
MZN 63.903078
NAD 16.165786
NGN 1362.669675
NIO 36.819394
NOK 9.501405
NPR 152.519028
NZD 1.71293
OMR 0.384503
PAB 1.000494
PEN 3.381269
PGK 4.425266
PHP 61.282024
PKR 277.903301
PLN 3.737398
PYG 5970.006852
QAR 3.647624
RON 4.543799
RSD 101.787001
RUB 82.901076
RWF 1473.717079
SAR 3.768513
SBD 8.064941
SCR 13.788169
SDG 600.443843
SEK 9.58211
SGD 1.28038
SHP 0.740866
SLE 24.549758
SLL 20969.497012
SOS 571.758165
SRD 37.670382
STD 20697.981008
STN 21.250298
SVC 8.75418
SYP 13001.999878
SZL 16.149806
THB 33.101982
TJS 9.254468
TMT 3.5
TND 2.937771
TOP 2.40776
TRY 47.772984
TTD 6.785291
TWD 32.170275
TZS 2649.998064
UAH 44.704688
UGX 3711.397434
UYU 40.271134
UZS 11963.328534
VES 765.412855
VND 26044
VUV 118.442804
WST 2.72999
XAF 568.945344
XAG 0.015292
XAU 0.000227
XCD 2.70255
XCG 1.803137
XDR 0.707585
XOF 568.947811
XPF 103.439901
YER 237.150271
ZAR 16.147015
ZMK 9001.248038
ZMW 18.829417
ZWL 321.999592
  • AEX

    -4.4700

    1112.28

    -0.4%

  • BEL20

    4.5700

    5723.27

    +0.08%

  • PX1

    -40.0900

    8674.94

    -0.46%

  • ISEQ

    219.1900

    14452.6

    +1.54%

  • OSEBX

    8.6200

    2061.99

    +0.42%

  • PSI20

    62.6400

    9273.84

    +0.68%

  • ENTEC

    -5.8300

    1416.23

    -0.41%

  • BIOTK

    56.5500

    4373.02

    +1.31%

  • N150

    7.7900

    4336.02

    +0.18%

L'intoxication des données, la menace invisible qui cible les chatbots IA
L'intoxication des données, la menace invisible qui cible les chatbots IA / Photo: © AFP/Archives

L'intoxication des données, la menace invisible qui cible les chatbots IA

Le recours aux agents conversationnels basés sur l'intelligence artificielle occupe une place croissante dans le rapport des utilisateurs à l'information. Mais aux biais et aux erreurs des "chatbots" s'ajoute la menace de manipulation des données sur lesquels ils sont entraînés.

Taille du texte:

. L'IA, cible de choix

ChatGPT, Mistral, Claude ou Gemini... Prisés des utilisateurs pour leur rapidité et leur facilité d'utilisation, les "chatbots" IA sont entraînés à formuler leurs réponses à partir de gigantesques bases de données regroupant des milliards de documents, inlassablement compilés et archivés par des "robots" qui parcourent internet en quête de données.

Il y apprennent comment, statistiquement, les mots s'enchaînent pour former des phrases et des idées, afin de pouvoir ensuite générer des réponses cohérentes qui ont le plus de chances de correspondre à la requête de l'usager.

Mais ce mode de collecte et d'entraînement expose les "chatbots" à de possibles manipulations par des acteurs malveillants, susceptibles d'introduire dans leurs données d'entraînement des éléments indésirables comme de la désinformation, de la propagande ou du code informatique malveillant.

. Empoisonnement, conditionnement

Chercheurs au Laboratoire d'investigation numérique de l'Atlantic council, un think tank d'étude des relations internationales, Valentin Châletet et Esteban Ponce de León distinguent deux concepts:

L'empoisonnement de données des grands modèles de langage (LLM) sur lesquels reposent les chatbots ("LLM poisoning") se produit en amont, lors de l'entraînement, via l'injection d'éléments non désirés. Ces manipulations sont pensées pour contourner les mécanismes de filtrage mis en place par les entreprises pour garantir des données fiables.

Le conditionnement ("LLM grooming") intervient plus tard, alors que le chatbot est déjà déployé: des acteurs malveillants diffusent massivement du contenu en ligne pour qu'il soit intégré par les modèles IA.

Ainsi, des tests menés par l'entreprise d'analyse de la fiabilité des contenus en ligne Newsguard ont montré que, dans diverses circonstances, les principaux chabots commerciaux pouvaient répondre en s'appuyant sur de fausses informations du réseau Pravda, une nébuleuse de sites web destinés à amplifier la propagande prorusse.

Ces manipulations peuvent être difficiles à repérer et endiguer, notamment parce que le fonctionnement de ces modèles est volontairement rendu opaque par leurs concepteurs: "On a affaire à un réseau de neurones qui fonctionne comme une boîte noire", explique Valentin Châtelet.

Expurger les données en question nécessiterait le plus souvent un réentraînement complet du modèle, estime le chercheur, et présenterait "un coût extrême" en temps et en ressources. La complexité de ces systèmes algorithmiques rend également très ardus leur audit ou leur régulation.

. "Désinformation à la demande"

Le phénomène est difficile à mesurer et son impact sur les utilisateurs complexe voire impossible à démontrer. Mais, difficilement traçables et relativement peu coûteuses, ces opérations ont de quoi séduire les acteurs qui souhaiteraient promouvoir leurs narratifs, qu'il s'agisse d'Etats, de lobbies ou d'entreprises.

"Ce type d'opération pourrait être mené par un groupe industriel qui veut enterrer les résultats d'une étude médicale scientifique qui ne va pas dans leur sens, par un homme politique qui veut pousser un récit qui va servir sa campagne...", énumère Chine Labbé, rédactrice en chef française de Newsguard.

Esteban Ponce de León observe pour sa part le développement d'un écosystème de "désinformation à la demande", au sein duquel des Etats ou des entités "délègueraient (...) l'opération à une autre entité, probablement privée, qui dispose déjà de l'expertise technologique nécessaire pour mener à bien" une campagne d'influence visant les LLM.

En septembre 2025, une entreprise dirigée par l'ancien directeur de campagne de Donald Trump a ainsi reçu plusieurs millions de dollars d'entreprises liées à l'Etat israélien pour diffuser des éléments de langage favorables via un réseau de sites web, avec pour objectif notamment d'influencer les réponses des chatbots, selon le think tank américain Quincy Institute for Responsible Statecraft.

Face au risque, les entreprises d'IA sont les premières concernées: il est ainsi crucial d'"apprendre aux chatbots à distinguer et à ne pas pondérer de la même manière les sources fiables et les sources de propagande étrangère ou de désinformation", argue Chine Labbé.

I.Ko--ThChM