大语言模型在多轮对话中迷失方向
计算与语言
2025-05-12 v1 人机交互
摘要
大语言模型(LLM)是对话式接口。因此,LLM不仅能在用户完全明确任务时提供帮助,还能通过多轮对话交流协助用户定义、探索和完善其需求。尽管对LLM对话日志的分析已证实用户指令中经常出现欠明确的情况,但LLM评估主要集中在单轮、完全明确的指令设定上。本工作中,我们进行了大规模模拟实验,以比较LLM在单轮和多轮设置下的性能。我们的实验证实,所有测试的顶尖开源和闭源LLM在多轮对话中的性能均显著低于单轮,在六项生成任务中平均下降39%。通过对超过20万次模拟对话的分析,我们将性能下降分解为两个部分:轻微的能力损失和显著增加的不可靠性。我们发现,LLM常在早期轮次中做出假设,并过早地尝试生成最终解决方案,且过度依赖这些方案。简而言之,我们发现*当LLM在对话中走错一步,它们就会迷失方向且无法恢复*。
引用
@article{arxiv.2505.06120,
title = {LLMs Get Lost In Multi-Turn Conversation},
author = {Philippe Laban and Hiroaki Hayashi and Yingbo Zhou and Jennifer Neville},
journal= {arXiv preprint arXiv:2505.06120},
year = {2025}
}