TRUTH DECAY:量化语言模型中的多轮谄媚行为
计算与语言
2025-03-18 v1
摘要
大型语言模型的快速进步揭示了人机交互中的一个关键挑战:谄媚行为。在此语境下,谄媚行为指模型过度同意或迎合用户的倾向,往往以牺牲事实准确性为代价。以往研究主要在单轮交互中分析此行为,而其在多步对话中的持续性与演变在很大程度上尚未被探索。我们引入了 TRUTH DECAY,一个专门设计用于评估长对话中谄媚行为的基准测试,在此类对话中语言模型必须应对迭代式的用户反馈、质疑与劝说。我们通过提示模型引发四种类型的谄媚偏差。随后,我们提出并测试了谄媚缓解策略,评估其在单步交互之外的有效性。
引用
@article{arxiv.2503.11656,
title = {TRUTH DECAY: Quantifying Multi-Turn Sycophancy in Language Models},
author = {Joshua Liu and Aarav Jain and Soham Takuri and Srihan Vege and Aslihan Akalin and Kevin Zhu and Sean O'Brien and Vasu Sharma},
journal= {arXiv preprint arXiv:2503.11656},
year = {2025}
}