中文

小型语言模型情感几何的跨架构研究:表示、行为与方法论混淆因素

计算与语言 2026-04-14 v1 人工智能

摘要

我们在统一的理解模式管道下以 fp16 精度从十二个小型语言模型(六种架构 × 基础/指令,参数量从 1B 到 8B)中提取 21 维情感向量集合,并通过代表性相似性分析对原始余弦 RDM 进行比较。五个成熟架构(Qwen 2.5 1.5B、SmolLM2 1.7B、Llama 3.2 3B、Mistral 7B v0.3、Llama 3.1 8B)共享近乎相同的 21 维情感几何,两两 RDM 的 Spearman 相关系数在 0.74-0.92 之间。这种普遍性在 diametrically opposed 的行为特征之间仍然保持:Qwen 2.5 与 Llama 3.2 占据 MTI 合规 facets 的相反极点,但产生近乎相同的情感 RDM(rho = 0.81),因此行为特征差异源于情感表示之上。Gemma-3 1B 基础版本是我们数据集中唯一不成熟的案例,表现出极端残余流线各向异性(0.997),经 RLHF 调整后在所有几何描述符上都被重构,而这五个已成熟的家族显示出基准 × 指令 RDM 的系列内相关系数 rho >= 0.92(Mistral 7B v0.3 达到 rho = 0.985),表明 RLHF 仅重构尚未组织好的表示。方法论上,我们指出先前研究中所读的单一理解-生成方法效应事实上分解为四个 distinct 层次——粗粒度方法相关性异质、生成过程中的稳健亚参数灵敏性、真正的精度(fp16 vs INT8)效应,以及扭曲不同模型方向的跨实验偏置——因此,两个先前情感向量研究之间的单个 rho 不是在没有分层解构的情况下安全的解释依据。

关键词

引用

@article{arxiv.2604.11050,
  title  = {Shared Emotion Geometry Across Small Language Models: A Cross-Architecture Study of Representation, Behavior, and Methodological Confounds},
  author = {Jihoon Jeong},
  journal= {arXiv preprint arXiv:2604.11050},
  year   = {2026}
}

备注

34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine