中文

通过自监督能量式动作门控提升扩散规划器

机器学习 2026-03-04 v1 人工智能 机器人学

摘要

扩散规划器是离线强化学习中的强大方法,但当价值导向的选择偏好得分良好 yet 与环境动力学不一致的轨迹时,可能会失败,导致执行脆弱。我们提出了一种自监督动作门控能量方法(Self-supervised Action Gating with Energies, SAGE),这是一种在推理时重新排序的方法,通过惩罚动态不一致的计划。SAGE 在离线状态序列上训练联合嵌入预测架构(JEPA)编码器和动作条件潜在预测器,用于短视角过渡。在测试时,SAGE 为每个抽样候选方案分配能量,其潜在预测误差给出能量,并将此可行性得分与价值估计相结合,以选择动作。SAGE 可以集成到现有的扩散规划管道中,用于抽样轨迹和通过价值评分选择动作;它不需要环境滚动,也不需要策略重新训练。在 locomotion、navigation 和 manipulation 基准测试中,SAGE 提升了扩散规划器的性能和鲁棒性。

关键词

引用

@article{arxiv.2603.02650,
  title  = {Improving Diffusion Planners by Self-Supervised Action Gating with Energies},
  author = {Yuan Lu and Dongqi Han and Yansen Wang and Dongsheng Li},
  journal= {arXiv preprint arXiv:2603.02650},
  year   = {2026}
}