小语言模型中情感表征的提取与引导:方法学比较
计算与语言
2026-04-07 v1 人工智能
摘要
参数规模在 100M 至 10B 之间的小语言模型(SLMs)日益驱动生产系统,但它们是否拥有近期在前沿模型中发现的情感内部表征仍未知。我们首次对小语言模型的情感向量提取方法进行了比较分析,在 20 种情感和两种提取方法(基于生成的和基于理解的)下评估了涵盖 5 种架构家族(GPT-2、Gemma、Qwen、Llama、Mistral)的 9 个模型。基于生成的提取产生了统计上更优的情感分离效果(Mann-Whitney p = 0.007;Cohen's d = -107.5),其优势受指令微调和架构的调节。情感表征定位于 Transformer 中间层(约 50% 深度),呈现 U 形曲线,在 124M 至 3B 参数范围内架构不变。我们针对 4 个模型将结果与表征各向异性基线进行验证,并通过引导实验确认了因果行为效应,由外部情感分类器独立验证(92% 成功率,40 个场景中的 37 个)。引导揭示了三种模式——手术式(连贯文本转换)、重复崩溃和爆发式(文本退化)——由困惑度比率量化并由模型架构而非规模区分。我们记录了 Qwen 中的跨语言情感纠缠,引导激活了 RLHF 未抑制的语义对齐中文标记,引发多语言部署的安全担忧。本工作为小语言模型情感研究提供了方法学指南,并通过将外部行为画像与内部表征分析相连接,为 Model Medicine 系列做出了贡献。
引用
@article{arxiv.2604.04064,
title = {Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison},
author = {Jihoon Jeong},
journal= {arXiv preprint arXiv:2604.04064},
year = {2026}
}
备注
14 pages, 4 figures, 7 tables. Paper #6 in the Model Medicine series