中文

语言模型的定量内省:跨对话跟踪情感状态

人工智能 2026-04-14 v2

摘要

跟踪大语言模型在对话中内部状态对于安全、可解释性和模型福祉至关重要,但当前方法受限。线性探针和其他白盒方法不完美地压缩高维表示,且随模型规模增大应用更为困难。借鉴人类心理学中广泛使用的定量自我报告工具来追踪内部状态,我们探讨了 LLM 自身的定量自我报告是否能够跟踪由探针定义的情感状态。我们研究了四对概念(幸福感、兴趣、专注度和冲动性)在 40 轮十回合对话中的情况,将内省操作化为模型自我报告与概念匹配的探针定义内部状态之间的因果信息耦合。我们发现,贪婪解码的自我报告会将输出折叠到少数缺乏信息的值中,但通过计算基于 logits 的自我报告可显露内省能力。该指标跟踪可解释的内部状态(LLaMA-3.2-3B-Instruct 中的 Spearman ρ=0.40\rho = 0.40-0.760.76;等一性 R2=0.12R^2 = 0.12-0.540.54),随时间变化,激活定向确认了这种耦合是因果的。此外,我们发现内省在第一轮就存在,但通过对话演变,能够通过沿一个概念引导来提升另一个概念的内省能力(ΔR2\Delta R^2 最高可达 0.300.30)。关键的是,这些现象在某些情况下随模型规模增大,LLaMA-3.1-8B-Instruct 可接近 R20.93R^2 \approx 0.93,并在其他模型家族中部分复制。总体而言,这些结果将定量自我报告定位为跟踪对话式 AI 系统内部情感状态的可行、补充性工具。

关键词

引用

@article{arxiv.2603.18893,
  title  = {Quantitative Introspection in Language Models: Tracking Emotive States Across Conversation},
  author = {Nicolas Martorell and Bruno Bianchi},
  journal= {arXiv preprint arXiv:2603.18893},
  year   = {2026}
}