中文

条件化至关重要:扩散策略的训练速度比想象的快

机器人学 2025-05-19 v1 人工智能

摘要

扩散策略已成为构建视觉语言动作(VLA)模型的主流范式。尽管它们展示了强大的机器人控制能力,但训练效率仍不够理想。在本文中,我们识别了条件扩散策略训练中的一个根本性挑战:当生成条件难以区分时,训练目标会退化为建模边际动作分布,我们称之为损失崩溃。为克服这一问题,我们提出了一种简单且通用的解决方案Cocos,通过修改条件流匹配中的源分布,使其依赖于条件。通过将源分布锚定于从条件输入中提取的语义,Cocos鼓励更强的条件集成,防止损失崩溃。我们提供了理论依据,并通过仿真和真实世界基准的广泛实证结果证明其有效性。本方法实现了比现有方法更快的收敛速度和更高的成功率,在显著减少的梯度步骤和参数数量下,就能匹配大规模预训练VLA的性能。Cocos轻量、易于实现,且与多样的策略架构兼容,为扩散策略训练提供了一种通用性的改进。

关键词

引用

@article{arxiv.2505.11123,
  title  = {Conditioning Matters: Training Diffusion Policies is Faster Than You Think},
  author = {Zibin Dong and Yicheng Liu and Yinchuan Li and Hang Zhao and Jianye Hao},
  journal= {arXiv preprint arXiv:2505.11123},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2505.10105