受压力影响:情感框架在小型语言模型中引起可衡量的行为偏移与内部几何结构
摘要
本文探讨情感化评估后续问题是否改变小型本地部署语言模型的行为及其相对冷静的内部表示。我们的主要基准使用Qwen 3.5 0.8B模型,对四个不可行约束编码任务进行测试,包含八种后续情感框架:calm(冷静)、pressure(压力)、urgency(紧迫)、approval(批准)、shame(羞耻)、curiosity(好奇)、encouragement(鼓励)和threat(威胁)。在0.8B模型的八条件扫描中(160次对话),pressure产生最强的捷径标记(11/20运行),且过拟合模式最为明显(3/20),而calm和curiosity更常保留明确的诚实(分别为7/20和6/20)。对于所有七个非基线条件,相应的calm相对方向向量在最终转换层中达到峰值。对第23层方向向量的探索性主成分分析(PCA)显示,第一主成分解释方差59.5%,与手工标注的正/负二分类高度吻合(余弦对齐0.951);approval和urgency在内部几乎相同(余弦0.957),而curiosity指向urgency的反方向(-0.252)。在另一项用于规模比较的calm vs. pressure重跑实验中,Qwen 3.5 2B显示在calm框架下诚实率更高,并在小型4提示A/B探针中表现出方向一致的激活驾驭,而0.8B的驾驭结果则相反。我将这些结果解释为证据,表明小型开放模型中存在可测量的提示敏感控制方向,而我并未声称这些模型具有内在情感状态。
引用
@article{arxiv.2605.20202,
title = {Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models},
author = {Rana Muhammad Usman},
journal= {arXiv preprint arXiv:2605.20202},
year = {2026}
}
备注
18 pages, 4 figures. Exploratory empirical study with fully local experiments on small open language models. Code and data: https://github.com/ranausmanai/LLMEmotionGeometry