中文

EBT-Policy:能量机制激发显性物理推理能力

机器人学 2025-11-03 v1 人工智能

摘要

以生成模型参数化的隐式策略(如扩散策略)已成为机器人策略学习和视觉语言-动作(VLA)模型的标准。然而,这些方法常面临高计算成本、暴露偏差和不稳定的推理动力学问题,导致在分布迁移下出现发散。能量基模型(EBM)通过端到端学习能量景观并建模平衡动力学,提供改进的鲁棒性和降低的暴露偏差。尽管如此,基于EBM的策略模型历史上仍难以扩展。最近的工作表明,能量基Transformer(EBT)已展示了EBM在高维空间中的可扩展性,但其在解决机器人和现实环境核心挑战方面的潜能仍未得到充分探索。我们提出一种新的能量基架构,EBT-Policy,解决机器人和现实环境中的核心问题。在模拟和现实任务上,EBT-Policy consistently 超越基于扩散的策略,同时所需的训练和推理计算更少。令人惊讶的是,在某些任务上,EBT-Policy仅需两步推理即可收敛,较扩散策略的100步减少了50倍。此外,EBT-Policy展现出先前模型未见的显现能力,例如仅通过行为克隆即可在无显式重试训练的情况下从失败的动作序列中恢复。通过利用其标量能量进行不确定性感知推理和动态计算分配,EBT-Policy为在分布迁移下实现稳健、通用的机器人行为提供了可前景的路径。

关键词

引用

@article{arxiv.2510.27545,
  title  = {EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities},
  author = {Travis Davies and Yiqi Huang and Alexi Gladstone and Yunxin Liu and Xiang Chen and Heng Ji and Huxian Liu and Luhui Hu},
  journal= {arXiv preprint arXiv:2510.27545},
  year   = {2025}
}

备注

9 pages, 6 figures, 4 tables