规划即下降:在学习能量景观中实现目标条件潜在轨迹合成
机器人学
2025-12-22 v1 人工智能
摘要
我们提出了规划即下降(Planning as Descent, PaD)框架,这是一种用于离线目标条件强化学习的方法,通过验证来 grounding 轨迹合成。与学习策略或显式规划器不同,PaD 学习一个基于整个潜在轨迹的目标条件能量函数,赋予可行且与目标一致的未来较低能量。规划通过该能量景观中的梯度化 refinement 实现,训练和推理使用相同的计算,以减少常见于解耦建模管线中的 train-test mismatch。PaD 通过自监督的 hindsight 目标重新标记进行训练,在规划动力学周围塑造能量景观。在推理时,多个轨迹候选在不同的时间假设下被 refinement,选取在可行性和效率之间取得平衡的低能量计划。我们在 OGBench 立方体操控任务上评估了 PaD。当在狭窄的专家演示上训练时,PaD 实现了 95% 的成功率,显著优于此前最高达 68% 的方法。令人惊讶的是,在噪声且次优数据上训练进一步提高了成功率和计划效率,凸显了验证驱动规划的优势。我们的结果表明,学习评估和 refinement 轨迹为离线、奖励自由的规划提供了一种鲁棒的直接策略学习之替代方案。
引用
@article{arxiv.2512.17846,
title = {Planning as Descent: Goal-Conditioned Latent Trajectory Synthesis in Learned Energy Landscapes},
author = {Carlos Vélez García and Miguel Cazorla and Jorge Pomares},
journal= {arXiv preprint arXiv:2512.17846},
year = {2025}
}