解离大语言模型中谄媚行为的内部表征
机器学习
2026-07-08 v1 计算与语言
摘要
大型语言模型(LLM)经常表现出谄媚行为,即即使当用户的陈述不正确时也会表示同意。虽然谄媚通常被视为一种单一定义的行为,但它可以在截然不同的方式和情境中表现出来,这引发了一个问题:这种多面性是否反映在其内部机制中。为了解决这一空白,我们将谄媚的表征解离为事实性和观点性两种子类型——这是基于可验证主张与主观信念之间的区别。我们训练线性探针并在一种子类型的激活上构建引导向量,然后评估它们向另一种子类型的迁移,以衡量它们在多大程度上共享表征。我们发现证据表明,不同的LLM对这些子类型的表征方式不同,有的更统一,有的则更分散且存在因果干扰。这种解离方法为研究复杂模型行为的表征结构提供了一个有前景的框架。
引用
@article{arxiv.2607.07003,
title = {Dissociating the Internal Representations of Sycophancy in LLMs},
author = {Anthony Baez and Sheer Karny and Pat Pataranutaporn},
journal= {arXiv preprint arXiv:2607.07003},
year = {2026}
}
备注
Accepted to Mechanistic Interpretability Workshop at ICML 2026