语言模型能否遵循多轮交织指令?
计算与语言
2025-09-23 v3 人工智能
摘要
尽管在提升大型语言模型(LLM)的指令遵循能力方面取得了显著成就,但处理多条潜在交织或冲突指令的能力仍是一个巨大挑战。现实场景通常要求在时间跨度上保持多条指令的一致性,例如隐私保密、个人偏好和优先级排序,这要求模型具备整合多轮指令的复杂能力,并在指令交叉或冲突时谨慎平衡竞争目标。本文对 LLM 处理多轮指令的能力进行了系统研究,涵盖三个难度级别:(1) 从指令中检索信息,(2) 跨轮次跟踪与推理,(3) 解决指令间冲突。我们通过人在回路方法构建了包含约 1.1K 条高质量多轮对话的 MultiTurnInstruct 数据集,并归纳出九个能力类别,包括静态与动态、推理以及多任务处理。我们的发现揭示了不同能力之间有趣的权衡。尽管 GPT 模型展现出卓越的记忆力,但在需要选择性保留信息的隐私保护任务中表现不佳。较大的模型展现出更强的推理能力,但在解决冲突指令方面仍有困难。重要的是,这些性能差距不能仅归因于信息丢失,因为模型在记忆任务上表现出很高的 BLEU 分数。然而,它们的注意力机制无法有效整合多条相关指令。这些发现突显了涉及多轮指令的复杂现实任务中亟待改进的关键领域。数据和代码已发布于 https://github.com/Glaciohound/Multi-Turn-Instruct。
引用
@article{arxiv.2503.13222,
title = {Can Language Models Follow Multiple Turns of Entangled Instructions?},
author = {Chi Han and Xin Liu and Haodong Wang and Shiyang Li and Jingfeng Yang and Haoming Jiang and Zhengyang Wang and Qingyu Yin and Liang Qiu and Changlong Yu and Yifan Gao and Zheng Li and Bing Yin and Jingbo Shang and Heng Ji},
journal= {arXiv preprint arXiv:2503.13222},
year = {2025}
}
备注
The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025) Findings