SEQUOR:多轮真实约束跟随基准
计算与语言
2026-05-11 v2
摘要
在对话中,一个有帮助的助手必须可靠地遵循用户指令,即使这些指令在细化、修改或相互矛盾后也应如此。然而,大多数指令跟随基准仅关注单轮或短多轮情景,尚未探讨模型如何处理长程指令跟随任务。为填补这一差距,我们提出 SEQUOR,一个用于评估长期多轮对话中约束遵循能力的自动基准。SEQUOR 由基于真实对话中提取约束的模拟 persona 驱动 interaction 构成。我们的结果表明,即使仅遵循单个约束,指令跟随准确率也随着对话长度的增加而持续下降,降幅超过 11%。当模型需要同时遵循多个约束时,准确率下降更为显著,降幅超过 40%。在约束在对话任意点被添加或替换的情景下,模型准确率下降超过 9%。综上所述,我们的结果揭示了当前模型在多轮对话中仍难以遵循用户指令,同时提供了更好衡量助手指令跟随能力的方法。
引用
@article{arxiv.2605.06353,
title = {SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following},
author = {Beatriz Canaverde and Duarte M. Alves and José Pombal and Giuseppe Attanasio and André F. T. Martins},
journal= {arXiv preprint arXiv:2605.06353},
year = {2026}
}