The China Mail - L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent

USD -
AED 3.672993
AFN 63.502337
ALL 80.613613
AMD 362.984224
ANG 1.790365
AOA 918.000306
ARS 1519.863298
AUD 1.426305
AWG 1.80075
AZN 1.696448
BAM 1.719362
BBD 2.013934
BDT 123.259913
BGN 1.683441
BHD 0.376975
BIF 3012.118628
BMD 1
BND 1.279555
BOB 12.083357
BRL 5.191801
BSD 0.99989
BTN 95.896685
BWP 13.671269
BYN 3.043562
BYR 19600
BZD 2.011077
CAD 1.414825
CDF 2310.000082
CHF 0.828795
CLF 0.02439
CLP 963.040182
CNY 6.71135
CNH 6.718765
COP 3358.43
CRC 454.603398
CUC 1
CUP 23.997046
CVE 96.934985
CZK 21.45945
DJF 178.062622
DKK 6.57376
DOP 59.421086
DZD 133.648751
EGP 51.778596
ERN 15
ETB 163.328249
EUR 0.87937
FJD 2.24725
FKP 0.754629
GBP 0.756805
GEL 2.614982
GGP 0.754629
GHS 11.588419
GIP 0.754629
GMD 73.502618
GNF 8793.962118
GTQ 7.636078
GYD 209.201637
HKD 7.843555
HNL 26.835755
HRK 6.6254
HTG 130.857718
HUF 321.952502
IDR 17950
ILS 3.04725
IMP 0.754629
INR 95.94225
IQD 1309.861322
IRR 1374574.999833
ISK 120.649786
JEP 0.754629
JMD 157.698783
JOD 0.708981
JPY 158.407497
KES 129.540408
KGS 87.449699
KHR 4067.745948
KMF 432.999976
KPW 900.000318
KRW 1360.226387
KWD 0.30885
KYD 0.83322
KZT 441.682088
LAK 22412.209177
LBP 89544.067871
LKR 330.008835
LRD 171.983174
LSL 16.425661
LTL 2.95274
LVL 0.60489
LYD 6.394922
MAD 9.573588
MDL 17.793016
MGA 4383.315971
MKD 54.087199
MMK 2099.566963
MNT 3597.939506
MOP 8.077009
MRU 40.026198
MUR 47.450485
MVR 15.450202
MWK 1733.809819
MXN 17.74077
MYR 4.076102
MZN 63.910134
NAD 16.425805
NGN 1326.319561
NIO 36.800485
NOK 9.52804
NPR 153.437218
NZD 1.769115
OMR 0.384491
PAB 0.999899
PEN 3.387384
PGK 4.454545
PHP 62.645499
PKR 277.045789
PLN 3.85265
PYG 5925.404954
QAR 3.644699
RON 4.640103
RSD 103.241005
RUB 85.000374
RWF 1479.316211
SAR 3.762907
SBD 8.000512
SCR 13.926164
SDG 601.504684
SEK 9.928435
SGD 1.279215
SHP 0.755002
SLE 24.649996
SLL 20969.491881
SOS 571.436107
SRD 37.695037
STD 20697.981008
STN 21.538651
SVC 8.748896
SYP 13002.000254
SZL 16.42205
THB 33.435503
TJS 9.214019
TMT 3.51
TND 2.957763
TOP 2.40776
TRY 48.9475
TTD 6.800789
TWD 31.774198
TZS 2644.998012
UAH 45.01655
UGX 3924.343855
UYU 40.061362
UZS 11808.195936
VES 852.43145
VND 25986
VUV 118.51472
WST 2.751818
XAF 576.828598
XAG 0.015637
XAU 0.000233419076
XCD 2.70255
XCG 1.801982
XDR 0.707052
XOF 576.828598
XPF 104.842574
YER 236.64984
ZAR 16.42023
ZMK 9001.194046
ZMW 19.448767
ZWL 321.999592
SSP 5712.591861
MXV 2.010544
  • AEX

    -1.1100

    1106.84

    -0.1%

  • BEL20

    -15.9200

    5671.16

    -0.28%

  • PX1

    -42.2400

    8081.43

    -0.52%

  • ISEQ

    -126.1300

    14206.65

    -0.88%

  • OSEBX

    0.0000

    2096.66

    0%

  • PSI20

    52.0200

    9684.67

    +0.54%

  • ENTEC

    -5.8300

    1416.23

    -0.41%

  • BIOTK

    -45.1600

    4425.67

    -1.01%

  • N150

    -37.9800

    4229.32

    -0.89%

L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent / Photo: © AFP/Archives

L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent

Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.

Taille du texte:

Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.

Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.

Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.

o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).

Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.

Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.

"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."

Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.

Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.

Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).

Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.

Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.

- L'IA en justice? -

"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.

Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.

Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.

"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".

Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.

Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.

Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.

Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".

Q.Moore--ThChM