The China Mail - L'intoxication des données, la menace invisible qui cible les chatbots IA

USD -
AED 3.672496
AFN 63.999637
ALL 81.031648
AMD 363.340421
ANG 1.790365
AOA 918.00039
ARS 1524.754198
AUD 1.42291
AWG 1.8
AZN 1.705597
BAM 1.7198
BBD 2.014334
BDT 123.134148
BGN 1.683441
BHD 0.376974
BIF 2996.596875
BMD 1
BND 1.278343
BOB 12.245759
BRL 5.213957
BSD 1.000132
BTN 95.938305
BWP 13.673816
BYN 3.027326
BYR 19600
BZD 2.011326
CAD 1.41705
CDF 2340.000016
CHF 0.831345
CLF 0.024498
CLP 967.330009
CNY 6.71325
CNH 6.71147
COP 3369.37
CRC 454.20569
CUC 1
CUP 24.002462
CVE 96.96141
CZK 21.428982
DJF 177.720211
DKK 6.57103
DOP 59.542287
DZD 133.831434
EGP 52.098498
ERN 15
ETB 162.972098
EUR 0.87899
FJD 2.2357
FKP 0.754816
GBP 0.753755
GEL 2.615005
GGP 0.754816
GHS 11.635494
GIP 0.754816
GMD 73.502842
GNF 8795.170658
GTQ 7.637958
GYD 209.257745
HKD 7.845065
HNL 26.846287
HRK 6.623098
HTG 130.885748
HUF 322.531034
IDR 18028
ILS 3.079601
IMP 0.754816
INR 95.93595
IQD 1310.042516
IRR 1374837.501412
ISK 120.430169
JEP 0.754816
JMD 158.315197
JOD 0.708997
JPY 157.244022
KES 129.729755
KGS 87.448502
KHR 4059.056814
KMF 433.000183
KPW 900.000318
KRW 1359.710329
KWD 0.30877
KYD 0.833443
KZT 439.793707
LAK 22439.127338
LBP 89556.106612
LKR 331.022111
LRD 172.008688
LSL 16.434096
LTL 2.95274
LVL 0.60489
LYD 6.397263
MAD 9.630717
MDL 17.680991
MGA 4387.052523
MKD 54.140561
MMK 2099.83552
MNT 3596.071123
MOP 8.080829
MRU 40.062785
MUR 47.469788
MVR 15.449932
MWK 1734.1564
MXN 17.85501
MYR 4.081702
MZN 63.909937
NAD 16.434096
NGN 1327.039625
NIO 36.800429
NOK 9.53582
NPR 153.505837
NZD 1.762425
OMR 0.384496
PAB 1.000079
PEN 3.398334
PGK 4.52425
PHP 62.465498
PKR 277.095071
PLN 3.839965
PYG 5873.947548
QAR 3.645277
RON 4.639494
RSD 103.307008
RUB 84.497761
RWF 1476.596231
SAR 3.755913
SBD 8.000512
SCR 13.873396
SDG 601.497925
SEK 9.94721
SGD 1.276995
SHP 0.755002
SLE 24.650298
SLL 20969.491881
SOS 571.60445
SRD 37.686023
STD 20697.981008
STN 21.545091
SVC 8.750324
SYP 13002.000254
SZL 16.429972
THB 33.563002
TJS 9.225649
TMT 3.51
TND 2.961507
TOP 2.40776
TRY 48.980798
TTD 6.787754
TWD 31.767976
TZS 2635.00303
UAH 44.876871
UGX 3914.861437
UYU 40.089518
UZS 11815.811573
VES 852.43145
VND 25974.5
VUV 117.801098
WST 2.745718
XAF 576.579692
XAG 0.01632
XAU 0.000241767514
XCD 2.70255
XCG 1.802386
XDR 0.707052
XOF 576.579692
XPF 104.870231
YER 236.649809
ZAR 16.393875
ZMK 9001.204285
ZMW 19.476614
ZWL 321.999592
SSP 5712.591902
MXV 2.022034
  • AEX

    4.0000

    1116.12

    +0.36%

  • BEL20

    -18.8200

    5685.37

    -0.33%

  • PX1

    0.8100

    8078.48

    +0.01%

  • ISEQ

    80.5400

    14463.32

    +0.56%

  • OSEBX

    11.8700

    2094.49

    +0.57%

  • PSI20

    7.7600

    9712.35

    +0.08%

  • ENTEC

    -5.8300

    1416.23

    -0.41%

  • BIOTK

    12.0700

    4481.36

    +0.27%

  • N150

    6.3500

    4240.43

    +0.15%

L'intoxication des données, la menace invisible qui cible les chatbots IA
L'intoxication des données, la menace invisible qui cible les chatbots IA / Photo: © AFP/Archives

L'intoxication des données, la menace invisible qui cible les chatbots IA

Le recours aux agents conversationnels basés sur l'intelligence artificielle occupe une place croissante dans le rapport des utilisateurs à l'information. Mais aux biais et aux erreurs des "chatbots" s'ajoute la menace de manipulation des données sur lesquels ils sont entraînés.

Taille du texte:

. L'IA, cible de choix

ChatGPT, Mistral, Claude ou Gemini... Prisés des utilisateurs pour leur rapidité et leur facilité d'utilisation, les "chatbots" IA sont entraînés à formuler leurs réponses à partir de gigantesques bases de données regroupant des milliards de documents, inlassablement compilés et archivés par des "robots" qui parcourent internet en quête de données.

Il y apprennent comment, statistiquement, les mots s'enchaînent pour former des phrases et des idées, afin de pouvoir ensuite générer des réponses cohérentes qui ont le plus de chances de correspondre à la requête de l'usager.

Mais ce mode de collecte et d'entraînement expose les "chatbots" à de possibles manipulations par des acteurs malveillants, susceptibles d'introduire dans leurs données d'entraînement des éléments indésirables comme de la désinformation, de la propagande ou du code informatique malveillant.

. Empoisonnement, conditionnement

Chercheurs au Laboratoire d'investigation numérique de l'Atlantic council, un think tank d'étude des relations internationales, Valentin Châletet et Esteban Ponce de León distinguent deux concepts:

L'empoisonnement de données des grands modèles de langage (LLM) sur lesquels reposent les chatbots ("LLM poisoning") se produit en amont, lors de l'entraînement, via l'injection d'éléments non désirés. Ces manipulations sont pensées pour contourner les mécanismes de filtrage mis en place par les entreprises pour garantir des données fiables.

Le conditionnement ("LLM grooming") intervient plus tard, alors que le chatbot est déjà déployé: des acteurs malveillants diffusent massivement du contenu en ligne pour qu'il soit intégré par les modèles IA.

Ainsi, des tests menés par l'entreprise d'analyse de la fiabilité des contenus en ligne Newsguard ont montré que, dans diverses circonstances, les principaux chabots commerciaux pouvaient répondre en s'appuyant sur de fausses informations du réseau Pravda, une nébuleuse de sites web destinés à amplifier la propagande prorusse.

Ces manipulations peuvent être difficiles à repérer et endiguer, notamment parce que le fonctionnement de ces modèles est volontairement rendu opaque par leurs concepteurs: "On a affaire à un réseau de neurones qui fonctionne comme une boîte noire", explique Valentin Châtelet.

Expurger les données en question nécessiterait le plus souvent un réentraînement complet du modèle, estime le chercheur, et présenterait "un coût extrême" en temps et en ressources. La complexité de ces systèmes algorithmiques rend également très ardus leur audit ou leur régulation.

. "Désinformation à la demande"

Le phénomène est difficile à mesurer et son impact sur les utilisateurs complexe voire impossible à démontrer. Mais, difficilement traçables et relativement peu coûteuses, ces opérations ont de quoi séduire les acteurs qui souhaiteraient promouvoir leurs narratifs, qu'il s'agisse d'Etats, de lobbies ou d'entreprises.

"Ce type d'opération pourrait être mené par un groupe industriel qui veut enterrer les résultats d'une étude médicale scientifique qui ne va pas dans leur sens, par un homme politique qui veut pousser un récit qui va servir sa campagne...", énumère Chine Labbé, rédactrice en chef française de Newsguard.

Esteban Ponce de León observe pour sa part le développement d'un écosystème de "désinformation à la demande", au sein duquel des Etats ou des entités "délègueraient (...) l'opération à une autre entité, probablement privée, qui dispose déjà de l'expertise technologique nécessaire pour mener à bien" une campagne d'influence visant les LLM.

En septembre 2025, une entreprise dirigée par l'ancien directeur de campagne de Donald Trump a ainsi reçu plusieurs millions de dollars d'entreprises liées à l'Etat israélien pour diffuser des éléments de langage favorables via un réseau de sites web, avec pour objectif notamment d'influencer les réponses des chatbots, selon le think tank américain Quincy Institute for Responsible Statecraft.

Face au risque, les entreprises d'IA sont les premières concernées: il est ainsi crucial d'"apprendre aux chatbots à distinguer et à ne pas pondérer de la même manière les sources fiables et les sources de propagande étrangère ou de désinformation", argue Chine Labbé.

I.Ko--ThChM