Interpretabilidad Mecanicista de LLMs aplicada al Análisis de Sentimientos y Emociones

dc.contributorLópez Ramírez, Cristina
dc.contributor.id0000-0001-6010-2023
dc.contributor.idtwo0000-0002-0660-9285
dc.contributor.roleasesorTesis
dc.contributor.roletwocolaborador
dc.contributor.twoRamos-Aguilar, Ricardo
dc.creatorQuintero Sánchez, Eduardo Ander
dc.creator.id0009-0007-6372-7257
dc.date.accessioned2026-07-30T18:48:53Z
dc.date.issued2026-08-01
dc.description.abstractLos modelos de lenguaje grande han mostrado un desempeño relevante en tareas de procesamiento de lenguaje natural, incluido el análisis y clasificación de emociones. Sin embargo, su creciente complejidad dificulta comprender qué representaciones internas influyen en sus predicciones. Esta tesis aborda este problema mediante el uso de sparse autoencoders para descomponer activaciones internas en características latentes potencialmente interpretables. La metodología consistió en obtener activaciones internas de un modelo de lenguaje de la familia LLaMA a partir de un corpus etiquetado con categorías emocionales, entrenar un sparse autoencoder y analizar la relación entre sus dimensiones latentes y las predicciones del modelo. Posteriormente, se realizaron intervenciones controladas sobre características latentes seleccionadas y aleatorias, midiendo sus efectos mediante cambios en probabilidad y log-odds. Los resultados muestran que el steering latente mediante sparse autoencoders produce cambios medibles y estructurados en la evidencia emocional del modelo. Algunas características individuales presentan perfiles de respuesta diferenciados entre clases emocionales, lo que permite inspeccionar cómo ciertas intervenciones modifican la salida del modelo. No obstante, las comparaciones agregadas no muestran una ventaja cuantitativa robusta frente a características aleatorias. En conjunto, la tesis muestra que los sparse autoencoders pueden utilizarse para analizar e intervenir representaciones internas de modelos de lenguaje en tareas de análisis de emociones. Aunque los resultados no implican características emocionales perfectamente especializadas, sí evidencian que el espacio latente aprendido contiene direcciones cuya intervención modifica de manera sistemática la evidencia emocional del modelo.
dc.division9
dc.format1
dc.identifier.urihttps://ri.ujat.mx/handle/200.500.12107/294
dc.language.isospa
dc.publisher.universityUniversidad Juárez Autónoma de Tabasco.
dc.rightsinfo:eu-repo/semantics/openAccess
dc.rights.licensehttp://creativecommons.org/licenses/by-nc-sa/4.0
dc.subjectsparse autoencoders
dc.subjectinterpretabilidad mecanicista
dc.subjectmodelos de lenguaje
dc.subjectsteering latente
dc.subjectanálisis de emociones
dc.subject.ctiinfo:eu-repo/classification/cti/7
dc.titleInterpretabilidad Mecanicista de LLMs aplicada al Análisis de Sentimientos y Emociones
local.Ods9

Archivos

Bloque original

Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
Eduardo Ander Quintero Sánchez.pdf
Tamaño:
4.6 MB
Formato:
Adobe Portable Document Format

Bloque de licencias

Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
license.txt
Tamaño:
1.71 KB
Formato:
Item-specific license agreed to upon submission
Descripción: