中文

同一证据,不同答案:面向多轮语言模型的规范-上下文 在策略蒸馏

计算与语言 2026-05-29 v1 人工智能

摘要

大型语言模型(LLM)在所有指令单一 prompt 中能解决任务,但当相同信息在多轮对话中逐步揭示时往往失败。当干净的 FULL prompt 与 RAW-SHARDED 对话包含相同的完整用户证据时,模型仍应得出相同答案。我们认为,此差距的关键原因是自锚漂移:在部分信息下生成的响应会引入不受支持的假设,而这些假设随后扭曲最终答案。为减少此影响,我们提出规范-上下文 在策略蒸馏(CCOPD)。在训练过程中,同一基础模型以两个角色运行:一个冻结教师基于干净的 FULL prompt 进行条件化,一个可训练学生通过多轮对话逐步接收相同证据;CCOPD 将学生在其自身轨迹上的行为与教师在规范完整上下文下的行为进行对齐。仅基于数学问题对话训练的 CCOPD 在数学和五个零样本 out-of-domain 任务族中,使 RAW-SHARDED 性能平均提升 32%,同时基本保持了完整上下文性能。进一步分析表明,CCOPD 加强了对用户证据的 grounding,并减少了来自 earlier assistant 轮次的敏感性。

关键词

引用

@article{arxiv.2605.30251,
  title  = {Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models},
  author = {Zizhuo Lin and Quanling Liu and Jinsheng Quan and Chao Zhang and Yifan Zhu and Xing Shi and Jingtao Xu and Zhihui Li and Yawei Luo},
  journal= {arXiv preprint arXiv:2605.30251},
  year   = {2026}
}