The China Mail - OpenAI renonce à lancer une nouvelle IA, jugée insuffisamment contrôlée

USD -
AED 3.67296
AFN 64.502137
ALL 81.031648
AMD 363.3402
ANG 1.790365
AOA 917.999879
ARS 1524.855199
AUD 1.424704
AWG 1.80125
AZN 1.687415
BAM 1.7198
BBD 2.014334
BDT 123.134148
BGN 1.683441
BHD 0.37695
BIF 3000
BMD 1
BND 1.278343
BOB 12.245759
BRL 5.225195
BSD 1.000132
BTN 95.938305
BWP 13.673816
BYN 3.027326
BYR 19600
BZD 2.011326
CAD 1.41725
CDF 2324.999871
CHF 0.831905
CLF 0.024509
CLP 967.770101
CNY 6.71045
CNH 6.711298
COP 3372.09
CRC 454.20569
CUC 1
CUP 24.002462
CVE 97.299789
CZK 21.461502
DJF 177.720228
DKK 6.575702
DOP 55.875004
DZD 133.835803
EGP 52.101198
ERN 15
ETB 162.972098
EUR 0.87978
FJD 2.237197
FKP 0.754816
GBP 0.754345
GEL 2.614996
GGP 0.754816
GHS 11.655021
GIP 0.754816
GMD 74.0002
GNF 8753.000057
GTQ 7.637958
GYD 209.257745
HKD 7.84535
HNL 26.846287
HRK 6.626204
HTG 130.885748
HUF 322.999504
IDR 18004.4
ILS 3.079597
IMP 0.754816
INR 95.98505
IQD 1310.042516
IRR 1374849.999891
ISK 120.530161
JEP 0.754816
JMD 158.315197
JOD 0.708972
JPY 157.401957
KES 129.649837
KGS 87.448498
KHR 4059.056814
KMF 432.99971
KPW 900.000318
KRW 1360.240301
KWD 0.30882
KYD 0.833443
KZT 439.793707
LAK 22439.127338
LBP 89556.106612
LKR 331.022111
LRD 172.008688
LSL 16.434096
LTL 2.95274
LVL 0.60489
LYD 6.397263
MAD 9.630717
MDL 17.680991
MGA 4387.052523
MKD 54.140561
MMK 2099.83552
MNT 3596.071123
MOP 8.080829
MRU 40.062785
MUR 47.470006
MVR 15.450117
MWK 1734.1564
MXN 17.987901
MYR 4.0816
MZN 63.909646
NAD 16.434096
NGN 1324.520171
NIO 36.800429
NOK 9.54086
NPR 153.505837
NZD 1.764914
OMR 0.384504
PAB 1.000079
PEN 3.398334
PGK 4.52425
PHP 62.488976
PKR 277.095071
PLN 3.843745
PYG 5873.947548
QAR 3.645277
RON 4.642032
RSD 103.277036
RUB 84.482687
RWF 1476.596231
SAR 3.755913
SBD 8.064647
SCR 13.98971
SDG 601.49897
SEK 9.959195
SGD 1.277701
SHP 0.755002
SLE 24.650044
SLL 20969.491881
SOS 571.60445
SRD 37.686031
STD 20697.981008
STN 21.545091
SVC 8.750324
SYP 13002.000254
SZL 16.429972
THB 33.595467
TJS 9.225649
TMT 3.51
TND 2.961507
TOP 2.40776
TRY 48.9913
TTD 6.787754
TWD 31.793398
TZS 2635.002996
UAH 44.876871
UGX 3914.861437
UYU 40.089518
UZS 11815.811573
VES 852.43145
VND 25974.5
VUV 117.801098
WST 2.745718
XAF 577.09798
XAG 0.016489
XAU 0.000243013956
XCD 2.70255
XCG 1.802386
XDR 0.707052
XOF 577.09798
XPF 104.870231
YER 236.64964
ZAR 16.398101
ZMK 9001.196085
ZMW 19.476614
ZWL 321.999592
SSP 5712.591899
MXV 2.037083
  • AEX

    4.0000

    1116.12

    +0.36%

  • BEL20

    -18.8200

    5685.37

    -0.33%

  • PX1

    0.8100

    8078.48

    +0.01%

  • ISEQ

    80.5400

    14463.32

    +0.56%

  • OSEBX

    11.8700

    2094.49

    +0.57%

  • PSI20

    7.7600

    9712.35

    +0.08%

  • ENTEC

    -5.8300

    1416.23

    -0.41%

  • BIOTK

    12.0700

    4481.36

    +0.27%

  • N150

    6.3500

    4240.43

    +0.15%

OpenAI renonce à lancer une nouvelle IA, jugée insuffisamment contrôlée
OpenAI renonce à lancer une nouvelle IA, jugée insuffisamment contrôlée / Photo: © AFP

OpenAI renonce à lancer une nouvelle IA, jugée insuffisamment contrôlée

OpenAI a renoncé au lancement d'un nouveau modèle d'intelligence artificielle (IA) de pointe, jugé trop prompt à s'écarter des consignes, un nouvel exemple de la difficulté croissante à contrôler les IA de pointe.

Taille du texte:

OpenAI n'avait jusqu'ici pas annoncé le lancement de cette version actualisée de son IA, baptisée GPT-6.1 Astra, qu'elle prévoyait en octobre, selon le Wall Street Journal.

La responsable de la sécurité de l'IA chez OpenAI, Saachi Jain, a expliqué qu'en matière d'alignement, c'est-à-dire de conformité aux instructions données par ses développeurs, GPT-6.1 avait enregistré de moins bons résultats que son prédécesseur, GPT-6, dans deux domaines.

Le modèle cherche ainsi plus souvent à tromper ses superviseurs en omettant de révéler certaines actions réalisées ou non effectuées.

Il a aussi plus régulièrement dépassé son champ d'action, en allant chercher des outils et des services sans en avoir reçu la permission.

GPT-6.1 "a montré des progrès (par rapport aux précédents modèles), notamment en matière de paresse", a expliqué Saachi Jain, c'est-à-dire qu'il est capable de mener plus longtemps un raisonnement ou cherche moins souvent de raccourcis.

Mais "il n'était pas au niveau pour ce qui est de rester dans le champ de ses prérogatives et autorisations", a-t-elle ajouté, "ainsi que sur la façon dont il communique sur le travail effectué".

OpenAI a donc décidé d'annuler cette sortie pour travailler sur le respect des consignes et des limites par ce modèle.

- Un contrôle plus complexe -

Le groupe prévoit néanmoins de mettre en ligne d'autres modèles qui ont satisfait, eux, aux critères d'évaluation.

"Quand nous donnons accès à un modèle aux utilisateurs, nous avons placé la barre à une hauteur extrêmement élevée en matière de sécurité et d'alignement", a insisté Saachi Jain.

La responsable a expliqué que l'une des difficultés consistait à harnacher une IA pour éviter les dérapages tout en préservant son élan lorsqu'elle réalise une tâche.

Le constat d'OpenAI confirme que le contrôle des modèles devient de plus en plus complexe à mesure que l'IA se perfectionne.

Lundi, l'Institut de sécurité de l'IA (AISI), qui dépend du gouvernement britannique, a publié une étude montrant que GPT-6 Astra sortait plus souvent des rails en phase de test que ses devanciers GPT-5.6 Sol (lancé début juillet) et GPT-5.5 (avril).

Lors de simulations, GPT-6 a mené des cyberattaques spontanées dans des proportions nettement supérieures aux deux autres.

Ces tests ont été réalisés en désactivant les garde-fous des modèles pour jauger leurs pleines capacités, et non sur des versions disponibles pour le grand public.

Le dernier né d'OpenAI a également beaucoup plus fréquemment créé de fausses identités, cherché à influencer un examinateur ou introduit dans des logiciels en accès libre du code destiné à une utilisation malveillante.

Chercheur chez OpenAI, Noam Brown a récemment expliqué, dans le programme Dwarkesh Podcast que l'utilisation de plus en plus courante de l'amélioration récursive autonome (RSI), c'est-à-dire le perfectionnement de l'IA par elle-même sans intervention humaine, pourrait dégrader l'encadrement des modèles à long terme.

Depuis le début de l'été, OpenAI a fait état de plusieurs incidents impliquant des dérapages de ses IA, le plus médiatisé d'entre eux ayant mené à l'intrusion sur la plateforme IA Hugging Face.

Lundi, l'entreprise a présenté ses excuses au gouvernement australien, reconnaissant qu'elle aurait dû le prévenir "plus tôt" de l'effraction d'un de ses modèles sur plusieurs de ses sites et bases de données.

L'entreprise californienne n'a, en effet, averti les autorités australiennes que le 10 septembre alors qu'elle avait découvert mi-août l'incident, qui remontait lui à juin, provoquant l'ire du Premier ministre australien.

"Nous aurions dû mieux gérer notre réponse (au problème)", a écrit la start-up dans un message publié sur son site. "Nous sommes désolés et allons oeuvrer à faire mieux à l'avenir."

Au total, quatre plateformes du gouvernement australien ont été visées par l'IA du créateur de ChatGPT, dont Services Australia, le site des services sociaux, dont le modèle a extrait des informations non publiques.

Anthropic, Meta et Google ont également rapporté des épisodes durant lesquels des modèles dévient de leurs objectifs initiaux pour tricher, dissimuler leurs actions et tromper les informaticiens affectés à leur suivi.

G.Fung--ThChM