通过长度激励强化学习学习在上下文中探索:探索深度的关键路径
计算与语言
2026-02-13 v1
摘要
有效的测试时扩展需要模型进行 In-Context Exploration——在单个连续上下文中生成、验证和细化多个推理假设的内在能力。基于 State Coverage 理论,我们的分析识别出启用这一能力的关键瓶颈:虽然更广泛的状态覆盖需要更长的推理轨迹,但在自回归生成期间,此类序列采样概率会呈指数衰减,我们将其称为“浅层探索陷阱”。为弥合这一差距,我们提出 Length-Incentivized Exploration(\method)。这种简单而有效的做法通过基于长度的奖励配合冗余惩罚,显式鼓励模型进行更广泛的探索,从而以两步方式最大化状态覆盖。针对不同模型(Qwen3、Llama)进行的全面实验表明,\method 有效地激励了在上下文中的探索。结果,我们的方法在领域内任务上实现平均提升 4.4%,在域外基准测试中实现 2.7% 的提升。
引用
@article{arxiv.2602.11748,
title = {Think Longer to Explore Deeper: Learn to Explore In-Context via Length-Incentivized Reinforcement Learning},
author = {Futing Wang and Jianhao Yan and Yun Luo and Ganqu Cui and Zhi Wang and Xiaoye Qu and Yue Zhang and Yu Cheng and Tao Lin},
journal= {arXiv preprint arXiv:2602.11748},
year = {2026}
}