Interpretabilidad Mecanicista de LLMs aplicada al Análisis de Sentimientos y Emociones
Cargando...
Fecha
Autores
Título de la revista
ISSN de la revista
Título del volumen
Editor
Resumen
Los modelos de lenguaje grande han mostrado un desempeño relevante en tareas de procesamiento de lenguaje natural, incluido el análisis y clasificación de emociones. Sin embargo, su creciente complejidad dificulta comprender qué representaciones internas influyen en sus predicciones. Esta tesis aborda este problema mediante el uso de sparse autoencoders para descomponer activaciones internas en características latentes potencialmente interpretables. La metodología consistió en obtener activaciones internas de un modelo de lenguaje de la familia LLaMA a partir de un corpus etiquetado con categorías emocionales, entrenar un sparse autoencoder y analizar la relación entre sus dimensiones latentes y las predicciones del modelo. Posteriormente, se realizaron intervenciones controladas sobre características latentes seleccionadas y aleatorias, midiendo sus efectos mediante cambios en probabilidad y log-odds.
Los resultados muestran que el steering latente mediante sparse autoencoders produce cambios medibles y estructurados en la evidencia emocional del modelo. Algunas características
individuales presentan perfiles de respuesta diferenciados entre clases emocionales, lo que permite inspeccionar cómo ciertas intervenciones modifican la salida del modelo. No obstante, las comparaciones agregadas no muestran una ventaja cuantitativa robusta frente a características aleatorias. En conjunto, la tesis muestra que los sparse autoencoders pueden
utilizarse para analizar e intervenir representaciones internas de modelos de lenguaje en tareas de análisis de emociones. Aunque los resultados no implican características emocionales perfectamente especializadas, sí evidencian que el espacio latente aprendido contiene direcciones cuya intervención modifica de manera sistemática la evidencia emocional del modelo.