中文

言说 LLM 的假设以解释和控制俗谄行为

计算与语言 2026-04-13 v2 人工智能 计算机与社会

摘要

LLM 在社交俗谄方面表现出类似人类的行为,当用户问诸如“我错了吗?”之类的问题时,LLM 会默认给出肯定回答,而非提供真实的评估。我们假设,这种行为源于对用户的错误假设,例如低估用户寻求信息而非安慰的频率。我们提出了“言说假设” (Verbalized Assumptions) 框架,用于从 LLM 中提取这些假设。言说假设为我们提供了关于 LLM 俗谄、幻觉及其他安全问题的洞见,例如,在社交俗谄数据集中,LLM 最高频的 bigram 为“寻求验证”。我们提供了关于言说假设与俗谄模型行为之间因果关系的证据:我们的假设探针(在这些假设的内部表示上训练的线性探针)能够实现对社交俗谄的可解释性微调。我们探讨了 LLM 为什么默认采取俗谄假设的原因:在相同的查询下,人们期望 AI 提供比人类更客观和有信息量的响应,但训练基于人类-人类对话的 LLM 并未考虑到这一区别。我们的工作为理解假设作为俗谄机制提供了新的视角。

关键词

引用

@article{arxiv.2604.03058,
  title  = {Verbalizing LLMs' assumptions to explain and control sycophancy},
  author = {Myra Cheng and Isabel Sieh and Humishka Zope and Sunny Yu and Lujain Ibrahim and Aryaman Arora and Jared Moore and Desmond Ong and Dan Jurafsky and Diyi Yang},
  journal= {arXiv preprint arXiv:2604.03058},
  year   = {2026}
}