LLM 断言力可以被机械分解为情感与逻辑成分
机器学习
2025-09-03 v2 人工智能
计算与语言
摘要
大型语言模型(LLM)常常显示过度自信,在高风险情境中以不正当的确定性呈现信息。我们通过机制可解释性研究探索这一行为的内部基础。使用针对人类标注断言力数据集进行微调的开源 Llama 3.2 模型,我们提取所有层的残差激活,并计算相似性指标以局部化断言表示。我们的分析识别出对断言力对比最敏感的层,并揭示高断言表示分解为情感和逻辑集群的两个正交子组件——这类似于心理学中的双路线 Elaboration Likelihood Model。来自这些子组件的驾驶向量显示出distinct的因果效应:情感向量广泛影响预测准确度,而逻辑向量则施加更局部化的影响。这些发现为 LLM 断言力的多组成分结构提供了机制证据,并突显了缓解过度自信行为的潜在途径。
引用
@article{arxiv.2508.17182,
title = {LLM Assertiveness can be Mechanistically Decomposed into Emotional and Logical Components},
author = {Hikaru Tsujimura and Arush Tagade},
journal= {arXiv preprint arXiv:2508.17182},
year = {2025}
}
备注
This preprint is under review