打破情境惯性:基于单轮锚点的强化学习用于稳定多轮交互
人工智能
2026-05-12 v2 计算与语言
摘要
虽然 LLM 在单轮中提供完整信息时表现出强大的推理能力,但在多轮交互中表现出显著的脆弱性。具体而言,当信息逐步揭示或需要更新时,模型经常无法整合新约束,导致其表现相对于单轮基准恶化。我们将根本原因称为情境惯性(Contextual Inertia),即模型僵化地遵循先前的推理痕迹的现象。即使用户在后续轮次明确提供更正或新数据,模型也会忽略这些信息,倾向于维持与其先前(错误)推理路径的一致性。为此,我们引入了强化学习与单轮锚点(Reinforce...)[RLSTA],一种通用的训练方法,旨在稳定跨不同场景和领域的多轮交互。RLSTA 利用模型在单轮中的优势能力作为稳定的内部锚点,以提供奖励信号。通过将多轮响应与这些锚点对齐,RLSTA 使模型能够打破情境惯性,根据最新信息自我校准其推理。实验表明,RLSTA 显著优于标准微调和放弃基于的方法。值得注意的是,我们的方法在跨领域泛化方面表现突出(例如,从数学到代码),并且即使在没有外部验证器的情况下也能有效工作,凸显其在通用领域应用的潜力。代码可在 https://github.com/Tencent/RLSTA 获取。
引用
@article{arxiv.2603.04783,
title = {Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction},
author = {Xingwu Chen and Zhanqiu Zhang and Yiwen Guo and Difan Zou},
journal= {arXiv preprint arXiv:2603.04783},
year = {2026}
}