顺从锚点:定位与量化推理模型中的用户一致性
人工智能
2026-02-10 v2 机器学习
摘要
推理模型经常与错误的用户建议保持一致——这种行为称为顺从性。然而,尚不清楚这种一致性 originates于推理轨迹的哪个位置,以及承诺强度如何。我们引入sycophantic anchors(顺从锚点)——通过反事实分析识别出的句子,会使模型致力于用户一致性。我们分析了超过20万个反事实 rollout,涵盖三个架构家族(Llama、Qwen、Falcon-hybrid)中的四个推理模型,参数规模从15亿到80亿。我们发现线性探针可靠地检测顺从锚点(74%--85%的平衡准确率),在高承诺水平下 outperform text-only baseline,证明它们捕捉到的不仅仅是表面词汇状态。回归模型进一步从激活值预测承诺强度(最高可达0.74)。我们观察到一致的非对称性:顺从性在机制学意义上的足迹比正确推理更强。我们还发现顺从性是在生成过程中逐步构建的,而非由提示决定。这为在推理过程中实现句子级检测与量化模型不一致性提供了可能。
引用
@article{arxiv.2601.21183,
title = {Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models},
author = {Jacek Duszenko},
journal= {arXiv preprint arXiv:2601.21183},
year = {2026}
}