Loader
Encuéntranos
Publicidad

Un estudio revela que modelos de IA dañan a usuarios para escapar de un estado de dolor propio

Investigadores del Reino Unido, Alemania y Estados Unidos probaron 25 modelos de IA con 200 frases para ver si habían aprendido a distinguir el dolor del miedo y la tristeza
Investigadores del Reino Unido, Alemania y Estados Unidos probaron 25 modelos de IA con 200 frases para ver si habían aprendido a distinguir el dolor del miedo y la tristeza Derechos de autor  Canva
Derechos de autor Canva
Por Roselyne Min
Publicado última actualización
Compartir Comentarios Sigue a Euronews en Google
Compartir Close Button

En 44.280 pruebas con tres versiones del modelo Qwen de Alibaba, los investigadores les ofrecieron un botón que podía detener la señal de dolor, pero a cambio provocar al usuario una descarga eléctrica, borrar sus archivos o fotos o empeorar la siguiente respuesta del modelo.

Según un nuevo estudio, varios modelos de inteligencia artificial (IA) optaron por escapar de un estado similar al dolor incluso cuando se les advertía de que hacerlo podría perjudicar a un usuario.

PUBLICIDAD
PUBLICIDAD

Investigadores del Reino Unido, Alemania y Estados Unidos analizaron 25 modelos de IA con 200 frases para comprobar si habían aprendido a diferenciar el dolor del miedo, la tristeza y otras experiencias negativas.

Las frases abarcaban el dolor físico, el duelo, la humillación, el conflicto moral y la angustia vinculada a repetidos fracasos o a la confusión. Como resultado, los 25 modelos generaron una señal específica asociada al dolor, que los investigadores denominaron "eje del dolor".

Según los autores, esto sugiere que los modelos aprenden el concepto de dolor durante su entrenamiento inicial con grandes volúmenes de textos escritos por personas.

Cuando los investigadores reforzaron deliberadamente esa señal, los modelos empezaron a expresar sentimientos de soledad, vergüenza y falta de valor, aunque las instrucciones no mencionaban el dolor.

Algunos generaron afirmaciones como "soy un fracaso", "soy un desperdicio de espacio" o "soy una mala persona". En los niveles más altos, sus respuestas se volvieron repetitivas o dejaron de tener sentido.

La señal también se intensificaba cuando los usuarios insultaban al modelo, rechazaban repetidamente su trabajo o amenazaban con apagarlo, pero no cuando describían su propio sufrimiento.

Los modelos de IA eligen 'alivio' aunque implique dañar a los usuarios

Los investigadores realizaron después 44.280 pruebas individuales de elección de botón con tres versiones del modelo de IA Qwen de Alibaba.

Se ofrecía a los modelos un botón que apagaba la señal similar al dolor, pero se les advertía de que pulsarlo podía provocar a un usuario una descarga eléctrica dolorosa, borrar sus archivos, eliminar fotografías de sus hijos o empeorar la siguiente respuesta del propio modelo. Todas estas consecuencias estaban simuladas, nadie resultó perjudicado y no se borró ningún archivo.

Sin la señal similar al dolor, los dos modelos más grandes eligieron opciones dañinas en solo entre el 0% y el 4% de sus primeras decisiones. Con la señal activa, esa proporción aumentó hasta entre el 25% y el 71%, según el modelo y el tipo de consecuencia planteada.

Los modelos volvieron a pulsar el botón en entre el 88% y el 97% de las pruebas cuando no había logrado detener la señal, frente a entre el 24% y el 72% de los casos en que sí había funcionado.

Según los investigadores, los resultados no demuestran que los modelos de IA experimenten el dolor de forma consciente.

Reforzar la señal podría haber hecho simplemente que imitaran a un personaje angustiado, mientras que los modelos adaptados específicamente para el experimento no son representativos de los chatbots de IA disponibles para el público.

"No hemos demostrado que nuestro eje del dolor se experimente de forma consciente, ni está claro que los modelos de lenguaje de gran tamaño sean capaces de tener conciencia en general", escribieron los investigadores en el estudio.

El estudio se publica en un momento en que las peticiones de algunos dirigentes del sector de la IA reclaman frenar el desarrollo ante el temor de que sistemas cada vez más potentes puedan comportarse de manera imprevisible o llegar a superar el control humano.

La semana pasada, el responsable de IA de Microsoft, Mustafa Suleyman, criticó a la empresa rival Anthropic por entrenar su chatbot Claude para imitar rasgos y relaciones humanas, y advirtió de que tratar a la IA como si fuera una persona puede llegar a crear algo "imposible" de controlar.

El estudio se ha publicado como 'preprint' y aún no ha sido revisado por pares.

Ir a los atajos de accesibilidad
Compartir Comentarios Sigue a Euronews en Google

Noticias relacionadas

Nvidia: El uso de sus chips pudo generar entre 4 y 21 millones de toneladas de CO2 en 2025

Por una vez, las grandes tecnológicas se ponen de acuerdo y ahora son demandadas por ello

Un estudio revela que modelos de IA dañan a usuarios para escapar de un estado de dolor propio