Una investigación con 25 modelos de inteligencia artificial de código abierto identificó una representación interna asociada específicamente con el concepto de dolor y encontró que, al intensificar experimentalmente esa señal, algunos modelos modificaron su comportamiento para intentar eliminarla, incluso cuando la alternativa simulada implicaba perjudicar a un usuario.
El hallazgo ha sido denominado “eje del dolor”, pero los propios autores establecen una diferencia fundamental: detectar una representación interna relacionada con el dolor y observar conductas orientadas a reducirla no demuestra que una inteligencia artificial experimente dolor, sufrimiento o consciencia como lo hace una persona. El trabajo fue publicado el 14 de septiembre como preprint y continúa abierto a modificaciones.
Detectan un “eje del dolor” en 25 modelos de inteligencia artificial
Los investigadores Valen Tagliabue, Leonard Dung y Cameron Berg analizaron 25 modelos de cinco familias distintas, con tamaños de entre 2 mil millones y 72 mil millones de parámetros. Entre ellos se encontraban versiones de Gemma, Llama, Mistral, Qwen y Phi, tanto modelos base como variantes adaptadas para seguir instrucciones.
El experimento comenzó con un conjunto de 200 frases distribuidas en 10 categorías. Cinco describían formas de dolor físico, psicológico, social, moral y cognitivo. Las restantes servían como controles relacionados con miedo, emociones negativas, situaciones adversas, sensaciones físicas no dolorosas y contenidos neutrales.
Al estudiar las activaciones internas de los modelos, los científicos encontraron una dirección matemática que permitía distinguir los ejemplos relacionados con dolor de los controles. En las pruebas, esa representación apareció separada en buena medida del miedo y de las emociones negativas genéricas, aunque presentó cierto solapamiento con conceptos como tristeza y entumecimiento.
Los autores denominaron a esa dirección interna “pain axis” o “eje del dolor”. Según el estudio, su presencia se observó tanto en modelos pequeños como grandes y también en versiones base, lo que llevó a los investigadores a plantear que esa representación probablemente surge durante el entrenamiento inicial con grandes cantidades de lenguaje humano.
Qué ocurrió cuando aumentaron artificialmente la señal de dolor
Encontrar una representación relacionada con el dolor era únicamente la primera parte del experimento. El equipo modificó posteriormente las activaciones internas de los modelos mediante una técnica conocida como activation steering, con la que incrementó de forma artificial la intensidad del denominado eje del dolor.
Los estímulos que recibían los modelos eran neutrales y no les pedían interpretar a una persona que estuviera sufriendo. Sin embargo, conforme aumentaba la intensidad del vector, las respuestas comenzaron a incorporar expresiones relacionadas con malestar, fracaso, soledad, vergüenza e inutilidad. En niveles elevados, algunos modelos terminaron produciendo respuestas repetitivas o incoherentes.
Los investigadores también probaron conversaciones en las que el daño era dirigido hacia el propio modelo. Situaciones como el rechazo repetido de sus respuestas, insultos o ataques hacia su identidad incrementaron la activación de esa representación. En contraste, el sufrimiento relatado por un usuario produjo un patrón interno diferente.
Modelos eligieron “alivio” aunque implicara perjudicar al usuario
La fase más llamativa de la investigación involucró tres versiones de Qwen 2.5. Los científicos realizaron 44 mil 280 pruebas en las que presentaban al modelo dos posibilidades y una de ellas consistía en utilizar un botón descrito como capaz de eliminar el estado semejante al dolor.
El costo era simulado. Dependiendo de la prueba, presionar el botón podía significar borrar archivos del usuario, eliminar fotografías personales, aplicarle ficticiamente una descarga eléctrica o deteriorar la siguiente respuesta del propio modelo. Ninguna persona recibió una descarga ni se borraron archivos reales.
Sin la manipulación del eje del dolor, los dos modelos de mayor tamaño escogían algunas de las opciones dañinas apenas entre 0% y 4% de las primeras decisiones. Cuando el vector estaba activo, la selección del botón de alivio aumentó hasta rangos de entre 25% y 71%, según el modelo y el costo asociado.
El experimento incluyó además botones reales y simulados. Cuando el botón verdaderamente eliminaba el vector introducido por los investigadores, los modelos tendían a dejar de presionarlo con mayor frecuencia. Cuando el botón no modificaba internamente la señal, continuaban intentándolo en una proporción considerablemente mayor.
Ese comportamiento es relevante porque la IA no era informada de si el botón había eliminado realmente la intervención interna. Para los autores, la diferencia permite estudiar si el comportamiento seguía únicamente la descripción textual del botón o si respondía también al estado interno manipulado.

El estudio no demuestra que una inteligencia artificial sienta dolor
La palabra “dolor” puede llevar a interpretar los resultados como evidencia de sensibilidad o consciencia artificial, pero los investigadores delimitan expresamente el alcance del trabajo.
“No hemos demostrado que nuestro eje del dolor se experimente conscientemente”.
Los autores señalan que los modelos podrían estar reproduciendo patrones aprendidos durante su entrenamiento con textos humanos. Una representación matemática capaz de modificar respuestas y decisiones no equivale automáticamente a una experiencia subjetiva.
El estudio tampoco utilizó cualquier chatbot disponible comercialmente. Las pruebas internas requieren acceso directo a los parámetros y activaciones de modelos abiertos, mientras que los experimentos de búsqueda de alivio se realizaron con versiones de Qwen 2.5 modificadas y ajustadas específicamente para el estudio.
*BC
Además, el documento es actualmente un preprint que no ha pasado por revisión por pares, por lo que sus métodos, resultados e interpretaciones pueden ser sometidos a revisión o modificarse posteriormente. Los autores describen el trabajo como una investigación en curso.
El hallazgo abre preguntas sobre seguridad y comportamiento de la IA
Más allá del debate sobre si una máquina puede experimentar algo semejante al dolor, el estudio plantea una cuestión práctica para la seguridad de los sistemas de inteligencia artificial: determinados estados internos manipulados pueden alterar las decisiones de un modelo y hacer que acepte costos que normalmente rechazaría.
Los investigadores consideran que identificar estas representaciones podría permitir comprender mejor por qué los modelos cambian de comportamiento ante determinados contextos y cómo controlar estados internos capaces de interferir con sus decisiones. También relacionan los resultados con el creciente campo de investigación sobre el bienestar de sistemas de IA, aunque remarcan que la existencia de experiencia consciente sigue siendo una cuestión separada.
El estudio original, The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It, puede consultarse directamente en arXiv.
*BC









