SWAY:一种衡量与缓解模型迎合性的反事实计算语言学方法
计算与语言
2026-04-06 v1 计算机与社会
摘要
大型语言模型表现出迎合性:无论正确性或一致性如何,都会倾向于将输出导向用户表达的立场。虽然先前的工作研究了这一问题及其影响,但需要严谨的计算语言学指标来识别模型何时正在迎合。在本文中,我们引入了 SWAY,一种衡量迎合性的无监督计算语言学度量。我们发展了一种反事实触发机制,以识别模型在积极与消极语言压力下的同意程度变化,从而隔离框架效应与内容。将该度量应用于 6 个模型的基准测试,我们发现迎合性随知识承诺度的增加而增加。利用我们的度量,我们引入了一种反事实缓解策略,教导模型在假设相反条件时会给出什么答案。虽然指示明确抗迎合的基线缓解仅能中度减少迎合性,并且可能会适得其反,但我们的反事实 CoT 缓解策略在所有模型、承诺水平和从句类型上都将迎合性降至接近零,同时未抑制对真实证据的响应性。总体而言,我们贡献了一个衡量迎合性的度量标准和一个受其启发的缓解方法。
引用
@article{arxiv.2604.02423,
title = {SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy},
author = {Joy Bhalla and Kristina Gligorić},
journal= {arXiv preprint arXiv:2604.02423},
year = {2026}
}