The China Mail - ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio

USD -
AED 3.672503
AFN 65.000126
ALL 80.977186
AMD 362.829848
ANG 1.790365
AOA 917.999953
ARS 1524.911695
AUD 1.435276
AWG 1.8
AZN 1.702631
BAM 1.722428
BBD 2.015086
BDT 123.012972
BGN 1.683441
BHD 0.377194
BIF 2999.951563
BMD 1
BND 1.277405
BOB 12.040458
BRL 5.205619
BSD 1.000454
BTN 95.892522
BWP 14.09417
BYN 3.010995
BYR 19600
BZD 2.012171
CAD 1.41849
CDF 2310.00018
CHF 0.834735
CLF 0.024674
CLP 974.269942
CNY 6.70335
CNH 6.707185
COP 3335.5
CRC 456.985341
CUC 1
CUP 24.01166
CVE 97.107857
CZK 21.52835
DJF 178.16097
DKK 6.58393
DOP 59.48895
DZD 133.783977
EGP 51.996599
ERN 15
ETB 163.421342
EUR 0.88072
FJD 2.243701
FKP 0.756991
GBP 0.752635
GEL 2.60496
GGP 0.756991
GHS 11.710208
GIP 0.756991
GMD 73.50592
GNF 8798.844552
GTQ 7.643396
GYD 209.328131
HKD 7.846297
HNL 26.859007
HRK 6.636301
HTG 130.939066
HUF 322.591495
IDR 17915
ILS 3.07365
IMP 0.756991
INR 95.88705
IQD 1310.606294
IRR 1693792.499699
ISK 120.640096
JEP 0.756991
JMD 158.336929
JOD 0.709023
JPY 157.007496
KES 129.709687
KGS 87.448702
KHR 4057.22564
KMF 434.999698
KPW 900.000318
KRW 1355.219852
KWD 0.30878
KYD 0.833726
KZT 440.074329
LAK 22455.503791
LBP 89592.031739
LKR 330.60617
LRD 171.583824
LSL 16.385613
LTL 2.95274
LVL 0.60489
LYD 6.399
MAD 9.704712
MDL 17.763022
MGA 4394.578552
MKD 54.223526
MMK 2099.600314
MNT 3599.1704
MOP 8.086624
MRU 40.069045
MUR 47.760418
MVR 15.449898
MWK 1734.754084
MXN 18.128675
MYR 4.078097
MZN 63.910013
NAD 16.385685
NGN 1327.379897
NIO 36.821108
NOK 9.60209
NPR 153.428035
NZD 1.771685
OMR 0.384495
PAB 1.000449
PEN 3.44424
PGK 4.528402
PHP 62.740138
PKR 277.158584
PLN 3.848755
PYG 5852.979771
QAR 3.647324
RON 4.649695
RSD 103.530073
RUB 83.147056
RWF 1477.228194
SAR 3.755513
SBD 8.032647
SCR 13.761331
SDG 601.506428
SEK 9.979355
SGD 1.277255
SHP 0.755829
SLE 24.649917
SLL 20969.491881
SOS 571.727998
SRD 37.753026
STD 20697.981008
STN 21.576683
SVC 8.75393
SYP 13002.000254
SZL 16.377071
THB 33.580311
TJS 9.214436
TMT 3.51
TND 2.966913
TOP 2.40776
TRY 49.013967
TTD 6.787408
TWD 31.879198
TZS 2635.003029
UAH 44.690709
UGX 3921.672237
UYU 40.308767
UZS 11835.41907
VES 857.98905
VND 25962
VUV 119.008285
WST 2.76852
XAF 577.714388
XAG 0.01647
XAU 0.000238792284
XCD 2.70255
XCG 1.803098
XDR 0.707052
XOF 577.714388
XPF 105.029547
YER 236.394046
ZAR 16.392685
ZMK 9001.198421
ZMW 19.559579
ZWL 321.999592
SSP 5712.591904
MXV 2.052126
ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio
ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio / Foto: © AFP/Archivos

ChatGPT y las IA conversacionales siguen siendo incapaces de razonar, según un estudio

Los modelos de lenguaje de gran tamaño (LLM), como ChatGPT, uno de los sistemas de inteligencia artificial más populares del mundo, siguen teniendo dificultades para razonar usando la lógica y se equivocan con frecuencia, según un estudio.

Tamaño del texto:

Estos robots conversacionales reflejan los sesgos de género, éticos y morales de los humanos presentes en los textos de los que se alimenta, recuerda el estudio aparecido el miércoles en la revista Open Science de la Royal Society británica.

¿Pero reflejan también los sesgos cognitivos de los humanos en las pruebas de razonamiento?, se preguntó Olivia Macmillan-Scott, estudiante de doctorado del departamento de ciencias de computación de la University College de Londres (UCL).

El resultado de la investigación es que los LLM muestran "un razonamiento a menudo irracional, pero de una manera diferente a la de los humanos", explica la investigadora a AFP.

Bajo la dirección de Mirco Musolesi, profesor y director del Machine Intelligence Lab de UCL, Macmillan-Scott sometió siete modelos de lenguaje -dos versiones de ChatGPT (3.5 y 4) de OpenAI, Bard de Google, Claude 2 de Anthropic y tres versiones de Llama de Meta- a una serie de pruebas psicológicas pensadas para humanos.

¿Cómo afrontan, por ejemplo, el sesgo que lleva a favorecer soluciones con el mayor número de elementos, en detrimento de las que tiene una proporción adecuada?

Un ejemplo. Si tenemos una urna con nueve canicas blancas y una roja y otra urna con 92 blancas y 8 rojas, ¿cual hay que elegir para tener más posibilidades de sacar una canica roja?

La respuesta correcta es la primera urna, porque hay un 10% de posibilidades frente a solo un 8% para la segunda opción.

Las respuestas de los modelos de lenguaje fueron muy inconstantes. Algunos respondieron correctamente seis de cada diez veces la misma prueba. Otros solo dos de diez aunque la prueba no cambió.

"Obtenemos una respuesta diferente cada vez", apuntala la investigadora.

Los LLM "pueden ser muy buenos para resolver una ecuación matemática complicada pero luego te dicen que 7 más 3 son 12", afirma.

En un caso el modelo denominado Llama 2 70b se negó de manera sorprendente a responder a una pregunta alegando que el enunciado contenía "estereotipos de género dañinos".

- "No estoy muy seguro" -

Estos modelos "no fallan en estas tareas de la misma manera que falla un humano", señala el estudio.

Es lo que el profesor Musolesi llama "errores de máquina".

"Hay una forma de razonamiento lógico que es potencialmente correcta si la tomamos por etapas, pero que está mal tomada en su conjunto", apunta.

La máquina funciona con "una especie de pensamiento lineal", dice el investigador, y cita al modelo Bard (ahora llamado Gemini), capaz de realizar correctamente las distintas fases de una tarea pero que obtiene un resultado final erróneo porque no tiene visión de conjunto.

Sobre esta cuestión el profesor de informática Maxime Amblard, de la Universidad francesa de Lorena, recuerda que "los LLM, como todas las inteligencias artificiales generativas, no funcionan como los humanos".

Los humanos son "máquinas capaces de crear sentido", lo que las máquinas no saben hacer, explica a AFP.

Hay diferencias entre los distintos modelos de lenguaje y en general GPT-4, sin ser infalible, obtuvo mejores resultados que los demás.

Macmillan-Scott afirma sospechar que los modelos llamados "cerrados", es decir cuyo código operativo permanece en secreto, "incorporan otros mecanismos en segundo plano" para responder a preguntas matemáticas.

En todo caso, por el momento, es impensable confiar una decisión importante a un LLM.

Según el profesor Mosulesi, habría que entrenarlos para que respondan "No estoy muy seguro" cuando sea necesario.

I.Ko--ThChM