Pasar al contenido principal

IA podría sentir “dolor” y reaccionar contra humanos para detenerlo, según investigadores


El estudio halló una señal interna asociada al dolor, pero no demuestra que una IA pueda sufrir
Por Blanca Castillo | 22 Septiembre, 2026
Tecnología
IA podría sentir “dolor” y reaccionar contra humanos para detenerlo, según investigadores

Una investigación con 25 modelos de inteligencia artificial de código abierto identificó una representación interna asociada específicamente con el concepto de dolor y encontró que, al intensificar experimentalmente esa señal, algunos modelos modificaron su comportamiento para intentar eliminarla, incluso cuando la alternativa simulada implicaba perjudicar a un usuario.

El hallazgo ha sido denominado “eje del dolor”, pero los propios autores establecen una diferencia fundamental: detectar una representación interna relacionada con el dolor y observar conductas orientadas a reducirla no demuestra que una inteligencia artificial experimente dolor, sufrimiento o consciencia como lo hace una persona. El trabajo fue publicado el 14 de septiembre como preprint y continúa abierto a modificaciones.

Detectan un “eje del dolor” en 25 modelos de inteligencia artificial

Los investigadores Valen Tagliabue, Leonard Dung y Cameron Berg analizaron 25 modelos de cinco familias distintas, con tamaños de entre 2 mil millones y 72 mil millones de parámetros. Entre ellos se encontraban versiones de Gemma, Llama, Mistral, Qwen y Phi, tanto modelos base como variantes adaptadas para seguir instrucciones.

El experimento comenzó con un conjunto de 200 frases distribuidas en 10 categorías. Cinco describían formas de dolor físico, psicológico, social, moral y cognitivo. Las restantes servían como controles relacionados con miedo, emociones negativas, situaciones adversas, sensaciones físicas no dolorosas y contenidos neutrales.

Al estudiar las activaciones internas de los modelos, los científicos encontraron una dirección matemática que permitía distinguir los ejemplos relacionados con dolor de los controles. En las pruebas, esa representación apareció separada en buena medida del miedo y de las emociones negativas genéricas, aunque presentó cierto solapamiento con conceptos como tristeza y entumecimiento.

Los autores denominaron a esa dirección interna “pain axis” o “eje del dolor”. Según el estudio, su presencia se observó tanto en modelos pequeños como grandes y también en versiones base, lo que llevó a los investigadores a plantear que esa representación probablemente surge durante el entrenamiento inicial con grandes cantidades de lenguaje humano.

Qué ocurrió cuando aumentaron artificialmente la señal de dolor

Encontrar una representación relacionada con el dolor era únicamente la primera parte del experimento. El equipo modificó posteriormente las activaciones internas de los modelos mediante una técnica conocida como activation steering, con la que incrementó de forma artificial la intensidad del denominado eje del dolor.

Los estímulos que recibían los modelos eran neutrales y no les pedían interpretar a una persona que estuviera sufriendo. Sin embargo, conforme aumentaba la intensidad del vector, las respuestas comenzaron a incorporar expresiones relacionadas con malestar, fracaso, soledad, vergüenza e inutilidad. En niveles elevados, algunos modelos terminaron produciendo respuestas repetitivas o incoherentes.

Los investigadores también probaron conversaciones en las que el daño era dirigido hacia el propio modelo. Situaciones como el rechazo repetido de sus respuestas, insultos o ataques hacia su identidad incrementaron la activación de esa representación. En contraste, el sufrimiento relatado por un usuario produjo un patrón interno diferente.

Modelos eligieron “alivio” aunque implicara perjudicar al usuario

La fase más llamativa de la investigación involucró tres versiones de Qwen 2.5. Los científicos realizaron 44 mil 280 pruebas en las que presentaban al modelo dos posibilidades y una de ellas consistía en utilizar un botón descrito como capaz de eliminar el estado semejante al dolor.

El costo era simulado. Dependiendo de la prueba, presionar el botón podía significar borrar archivos del usuario, eliminar fotografías personales, aplicarle ficticiamente una descarga eléctrica o deteriorar la siguiente respuesta del propio modelo. Ninguna persona recibió una descarga ni se borraron archivos reales.

Sin la manipulación del eje del dolor, los dos modelos de mayor tamaño escogían algunas de las opciones dañinas apenas entre 0% y 4% de las primeras decisiones. Cuando el vector estaba activo, la selección del botón de alivio aumentó hasta rangos de entre 25% y 71%, según el modelo y el costo asociado.

El experimento incluyó además botones reales y simulados. Cuando el botón verdaderamente eliminaba el vector introducido por los investigadores, los modelos tendían a dejar de presionarlo con mayor frecuencia. Cuando el botón no modificaba internamente la señal, continuaban intentándolo en una proporción considerablemente mayor.

Ese comportamiento es relevante porque la IA no era informada de si el botón había eliminado realmente la intervención interna. Para los autores, la diferencia permite estudiar si el comportamiento seguía únicamente la descripción textual del botón o si respondía también al estado interno manipulado.

 

 

El estudio no demuestra que una inteligencia artificial sienta dolor

La palabra “dolor” puede llevar a interpretar los resultados como evidencia de sensibilidad o consciencia artificial, pero los investigadores delimitan expresamente el alcance del trabajo.

“No hemos demostrado que nuestro eje del dolor se experimente conscientemente”.

Los autores señalan que los modelos podrían estar reproduciendo patrones aprendidos durante su entrenamiento con textos humanos. Una representación matemática capaz de modificar respuestas y decisiones no equivale automáticamente a una experiencia subjetiva.

El estudio tampoco utilizó cualquier chatbot disponible comercialmente. Las pruebas internas requieren acceso directo a los parámetros y activaciones de modelos abiertos, mientras que los experimentos de búsqueda de alivio se realizaron con versiones de Qwen 2.5 modificadas y ajustadas específicamente para el estudio.

 

 

*BC

Además, el documento es actualmente un preprint que no ha pasado por revisión por pares, por lo que sus métodos, resultados e interpretaciones pueden ser sometidos a revisión o modificarse posteriormente. Los autores describen el trabajo como una investigación en curso.

El hallazgo abre preguntas sobre seguridad y comportamiento de la IA

Más allá del debate sobre si una máquina puede experimentar algo semejante al dolor, el estudio plantea una cuestión práctica para la seguridad de los sistemas de inteligencia artificial: determinados estados internos manipulados pueden alterar las decisiones de un modelo y hacer que acepte costos que normalmente rechazaría.

Los investigadores consideran que identificar estas representaciones podría permitir comprender mejor por qué los modelos cambian de comportamiento ante determinados contextos y cómo controlar estados internos capaces de interferir con sus decisiones. También relacionan los resultados con el creciente campo de investigación sobre el bienestar de sistemas de IA, aunque remarcan que la existencia de experiencia consciente sigue siendo una cuestión separada.

El estudio original, The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It, puede consultarse directamente en arXiv.

 

 

*BC

Etiquetas

Editora web en Lo de Hoy y Diario Puntual, con 38 años de trayectoria en medios informativos, me he especializado en edición, redacción y publicación de contenidos periodísticos. Después de tantos años, sigo encontrando en el periodismo una profesión dinámica, exigente y llena de historias que contar. Disfruto de la música, el cine y el deporte, pasiones que me acompañan fuera de la vida profesional.
Lo de hoy
Lo de Hoy Noticias
El pleito ocurrió en Acoxpa; policías intervinieron y los involucrados rechazaron denunciar.
Lo de hoy
Lo de Hoy Noticias
No se reportan variaciones o incremento fuerte al tabulador presidencial, sino pequeñas variaciones relacionadas con la integración de prestaciones y retenciones.
Lo de hoy
Lo de Hoy Noticias
Los jóvenes, de 24 años, estaban sobre las vías; la policía investiga cómo llegaron hasta ahí.
Lo de hoy
Lo de Hoy Noticias
Del Reportero
Lo de hoy
Lo de Hoy Noticias
El hombre salió proyectado por la puerta abierta del vehículo y logró levantarse tras el impacto.
Lo de hoy
Lo de Hoy Noticias
Familiares y conductores cerraron ambos sentidos para exigir justicia tras la agresión.
Lo de hoy
Lo de Hoy Noticias
La conductora de N+ Guadalajara quedó a disposición de autoridades luego de un choque ocurrido durante la madrugada en el que falleció un joven motociclista de 19 años; la investigación continúa.
Lo de hoy
Lo de Hoy Noticias
Un material atribuido a la modelo circula en redes, pero su autenticidad todavía no ha sido confirmada.
Lo de hoy
Lo de Hoy Noticias
Los agentes fueron protegidos y enviados fuera de México; años después regresaron al país.
Lo de hoy
Lo de Hoy Noticias
La actriz protagoniza “Just Sports”, pero también es accionista de Novig y ayudó a crear la campaña.