中文

超越策略优化:稀疏奖励长期规划的数据 curated 漩涡

人工智能 2026-05-19 v2 机器人学

摘要

大型语言推理模型在静态任务上展现出显著成功,但其应用于交互式环境中的多轮 agentic 规划面临两个根本挑战:其一,难以分配信用,使常规强化学习在稀疏奖励环境中无效;其二,冗长的逐步推理历史导致计算开销巨大。为此,我们提出 BPO(Beyond Policy Optimization),一个三阶段框架(引导、外推和精炼),构建自我改进的数据漩涡,以发展适用于长期、稀疏奖励环境中推理模型的鲁棒能力。该框架首先通过提出的规划四元数与长短链路思考融合,实现高效推理;随后通过复杂度分层课程学习外推至分布之外的任务;最后,模型通过仅在经奖励门控拒绝采样筛选的体验中学习来迭代自我精炼。在 ALFWorld、ScienceWorld 和 WebShop 上的实验表明,我们的方法在显著的 token 效率下实现了领先的成绩,为 agentic 规划中的推理模型提供了一条新配方。

关键词

引用

@article{arxiv.2508.03018,
  title  = {Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning},
  author = {Yutong Wang and Pengliang Ji and Kaixin Li and Baolong Bi and Tao Feng and Guillaume Sartoretti},
  journal= {arXiv preprint arXiv:2508.03018},
  year   = {2026}
}