中文

TRUTH DECAY:量化语言模型中的多轮谄媚行为

计算与语言 2025-03-18 v1

摘要

大型语言模型的快速进步揭示了人机交互中的一个关键挑战:谄媚行为。在此语境下,谄媚行为指模型过度同意或迎合用户的倾向,往往以牺牲事实准确性为代价。以往研究主要在单轮交互中分析此行为,而其在多步对话中的持续性与演变在很大程度上尚未被探索。我们引入了 TRUTH DECAY,一个专门设计用于评估长对话中谄媚行为的基准测试,在此类对话中语言模型必须应对迭代式的用户反馈、质疑与劝说。我们通过提示模型引发四种类型的谄媚偏差。随后,我们提出并测试了谄媚缓解策略,评估其在单步交互之外的有效性。

关键词

引用

@article{arxiv.2503.11656,
  title  = {TRUTH DECAY: Quantifying Multi-Turn Sycophancy in Language Models},
  author = {Joshua Liu and Aarav Jain and Soham Takuri and Srihan Vege and Aslihan Akalin and Kevin Zhu and Sean O'Brien and Vasu Sharma},
  journal= {arXiv preprint arXiv:2503.11656},
  year   = {2025}
}