自适应粗到细次目标细化用于长期视角条件强化学习
机器学习
2026-05-28 v1
摘要
离线视角条件强化学习(GCRL)在长期任务中具有挑战性,其中遥远的状态-目标对提供的监督信号较弱,价值估计容易受到累积性引导误差的影响。层次方法通过引入中间子目标来缓解这一困难,但固定的时间抽象或固定层次深度可能与不同可达性时限的状态-目标对不匹配。我们提出了粗到细层次化目标强化学习框架(CFHRL),该框架在离线环境下自适应细化远程目标。从最终目标开始,CFHRL递归提议中间目标,基于回放支持的候选项进行训练,直到当前目标被估计为在学习可达性成本下具有本地可执行性为止。关键思想是,子目标无需是精确的中点或全局最优路径;它只需提供可靠的进度并减少剩余的到达难度,从而 enable 后续在更短时限内进行细化。进一步的风格化分析支持近似递归收缩的鲁棒性。在OGBench上进行实验表明,本方法在多个长期任务上均实现显著提升,消融实验验证了所提出的细化和停止机制。
引用
@article{arxiv.2605.28127,
title = {Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning},
author = {Kaiqiang Ke and Shenghong He and Chengdong Xu and Yuheng Luo and Xiangyuan Lan and Chao Yu},
journal= {arXiv preprint arXiv:2605.28127},
year = {2026}
}