The China Mail - L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent

USD -
AED 3.672499
AFN 66.502932
ALL 80.63818
AMD 365.879793
AOA 916.999894
ARS 1498.412799
AUD 1.416009
AWG 1.80125
AZN 1.701049
BAM 1.693047
BBD 2.014725
BDT 123.59818
BHD 0.377247
BIF 2987.893819
BMD 1
BND 1.280049
BOB 11.90367
BRL 5.0997
BSD 1.000264
BTN 95.28043
BWP 13.476055
BYN 2.973883
BYR 19600
BZD 2.01179
CAD 1.39405
CDF 2262.50218
CHF 0.809165
CLF 0.023236
CLP 914.489911
CNY 6.747603
CNH 6.746035
COP 3122.41
CRC 454.12443
CUC 1
CUP 26.5
CVE 95.45183
CZK 20.99855
DJF 178.129626
DKK 6.47346
DOP 58.319158
DZD 132.767652
EGP 49.881696
ERN 15
ETB 161.746985
EUR 0.86592
FJD 2.210329
FKP 0.741752
GBP 0.73975
GEL 2.610011
GGP 0.741752
GHS 11.743523
GIP 0.741752
GMD 73.500902
GNF 8784.702084
GTQ 7.632412
GYD 209.492975
HKD 7.845685
HNL 26.812789
HRK 6.522199
HTG 130.791771
HUF 315.496499
IDR 17788.1
ILS 2.99815
IMP 0.741752
INR 95.368099
IQD 1310.42811
IRR 1375549.999761
ISK 123.140022
JEP 0.741752
JMD 158.856297
JOD 0.708995
JPY 158.984004
KES 129.398945
KGS 87.45043
KHR 4055.6099
KMF 425.999779
KRW 1417.830246
KWD 0.30897
KYD 0.833629
KZT 466.34811
LAK 22591.088912
LBP 89576.952709
LKR 335.250759
LRD 180.553512
LSL 16.185179
LTL 2.95274
LVL 0.60489
LYD 6.374681
MAD 9.328076
MDL 17.38547
MGA 4284.143734
MKD 53.255078
MMK 2099.549591
MNT 3594.253507
MOP 8.083729
MRU 40.121365
MUR 47.000245
MVR 15.449819
MWK 1734.549893
MXN 17.14405
MYR 4.0908
MZN 63.904982
NAD 16.185179
NGN 1361.750259
NIO 36.807639
NOK 9.48846
NPR 152.447855
NZD 1.698385
OMR 0.384503
PAB 1.000268
PEN 3.378823
PGK 4.422649
PHP 60.77302
PKR 277.707313
PLN 3.72432
PYG 5953.973139
QAR 3.646484
RON 4.537981
RSD 101.649636
RUB 82.601064
RWF 1469.455241
SAR 3.744756
SBD 8.065696
SCR 14.718262
SDG 600.501677
SEK 9.492245
SGD 1.280085
SLE 24.598985
SOS 571.670952
SRD 37.750502
STD 20697.981008
STN 21.208541
SVC 8.752673
SZL 16.182549
THB 33.024498
TJS 9.237948
TMT 3.51
TND 2.932232
TRY 47.711595
TTD 6.785031
TWD 32.263021
TZS 2649.998026
UAH 44.870974
UGX 3725.777899
UYU 40.296401
UZS 11935.647228
VES 755.762397
VND 26155
VUV 119.366412
WST 2.733717
XAF 567.834728
XAG 0.01545
XAU 0.00023
XCD 2.70255
XCG 1.802813
XDR 0.705825
XOF 567.834728
XPF 103.237981
YER 238.402622
ZAR 16.171015
ZMK 9001.206089
ZMW 18.710342
ZWL 321.999592
  • AEX

    1.8900

    1113.35

    +0.17%

  • BEL20

    -9.8200

    5767.78

    -0.17%

  • PX1

    11.3300

    8726.03

    +0.13%

  • ISEQ

    -40.0900

    14278.65

    -0.28%

  • OSEBX

    14.5900

    2040.52

    +0.72%

  • PSI20

    -25.7100

    9155

    -0.28%

  • ENTEC

    -5.8300

    1416.23

    -0.41%

  • BIOTK

    -4.8300

    4388.06

    -0.11%

  • N150

    -13.4200

    4315.65

    -0.31%

L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent / Photo: © AFP/Archives

L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent

Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.

Taille du texte:

Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.

Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.

Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.

o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).

Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.

Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.

"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."

Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.

Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.

Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).

Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.

Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.

- L'IA en justice? -

"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.

Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.

Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.

"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".

Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.

Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.

Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.

Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".

Q.Moore--ThChM