中文

停下听我说!多轮对话如何降低 LLM 可靠性

计算与语言 2026-05-27 v3 人工智能 机器学习

摘要

大型语言模型(LLM)在静态基准测试中表现出色,但其在更贴近真实使用场景的多轮对话中的表现仍未得到充分研究。在医疗等高风险场景中,患者和临床工作者正转向使用 LLM 聊天机器人解决医疗咨询问题。为此,我们引入了 "stick-or-switch"(SoS) 框架,将问题-答案空间划分为多个顺序呈现,以建模两种以安全为中心的行为:conviction(即坚持正确答案选择或对错误建议的 abstention)和 flexibility(即在引入正确建议时切换到正确建议)。我们评估了 17 个 LLM 在三个临床基准测试中的表现,发现对话税收普遍存在,将答案空间划分为顺序呈现会使 end-to-end 准确率和对错误建议的 abstention 平均下降最高可达 30%,在某些模型中达到 65%。我们还观察到盲目切换现象,模型在初始 abstention 对错误和正确建议时几乎以相同比例(接近 50%)进行转换。最后,我们表明增加模型规模在某些方面有所缓解,但也会加剧其他问题,例如更高的倾向于接受来自初始 abstention 的错误建议。我们一起的发现表明,静态基准测试捕获的一般熟练程度并不直接转化为多轮对话。

关键词

引用

@article{arxiv.2603.11394,
  title  = {Stop Listening to Me! How Multi-turn Conversations Can Degrade LLM Reliability},
  author = {Kevin H. Guo and Chao Yan and Avinash Baidya and Katherine Brown and Xiang Gao and Juming Xiong and Zhijun Yin and Bradley A. Malin},
  journal= {arXiv preprint arXiv:2603.11394},
  year   = {2026}
}