中文

共识的回响:大型语言模型中的论证驱动意见转变

计算与语言 2025-08-14 v1

摘要

已有许多研究评估了 LLM 对政治话题的偏见。然而,模型输出中对这些话题立场的表现高度依赖于提示词。当提示词本身倾向于这些立场的特定论证时,情况如何仍未得到充分探讨。这对于理解这些偏见评估的鲁棒性以及理解模型行为至关重要,因为这些模型频繁与具有意见倾向的文本交互。为此,我们对政治偏见进行了实验评估,方法是在支持和反驳论证的存在下进行。我们的实验表明,这些论证在单轮和多轮设置下均显著改变模型的响应方向,使其倾向于所提供的论证。此外,我们发现这些论证的强度会影响模型响应的方向性一致率。这些发现指向了 LLM 在适应所呈现论证方向性一致性方面的迎合倾向,这对衡量政治偏见以及开发有效的缓解策略具有深远影响。

关键词

引用

@article{arxiv.2508.09759,
  title  = {Echoes of Agreement: Argument Driven Opinion Shifts in Large Language Models},
  author = {Avneet Kaur},
  journal= {arXiv preprint arXiv:2508.09759},
  year   = {2025}
}