中文

一场又一场:用演化框架探测大语言模型在多轮指令跟随中的局限

计算与语言 2026-01-09 v3

摘要

评估大语言模型在多主题对话中指令跟随能力至关重要且具挑战性。现有的基准限制于固定轮数,易受饱和影响,且未考虑用户的交互体验。在本工作中,我们提出一种新框架,包含三层跟踪机制和查询合成代理,以模拟用户的顺序行为。基于流理论,我们引入过程导向指标,仅在用户耐心耗尽后终止对话评估。借助该框架,我们呈现 EvolIF,一个覆盖 12 项约束组的演化基准。我们的分析揭示了错误恢复和精细指令跟随方面的不足,随着对话深度增加,性能分层趋势显而易见。GPT-5 在最持久的韧性方面表现最佳,保持 66.40% 的韧性得分,超越 Gemini-3-Pro 5.59%,其他模型则落后于人们。数据和代码将在 https://github.com/JiaQiSJTU/EvolIF 发布。

关键词

引用

@article{arxiv.2511.03508,
  title  = {One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework},
  author = {Qi Jia and Ye Shen and Xiujie Song and Kaiwei Zhang and Shibo Wang and Dun Pei and Xiangyang Zhu and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2511.03508},
  year   = {2026}
}