一致性政策:通过一致性蒸馏加速视觉-运动控制策略
机器人学
2024-07-02 v2 人工智能
摘要
许多机器人系统(如移动机械臂或四旋翼机)由于空间、重量和功耗限制,无法配备高端 GPU。这些限制阻止了这些系统利用需要高端 GPU 才能实现快速策略推断的最新视觉-运动策略架构。在本文中,我们提出了一致性政策(Consistency Policy),这是一种快速且功能相当于扩散政策( Diffusion Policy)的视觉-运动机器人控制方法。凭借其快速的推断速度,一致性政策可以在资源受限的机器人设置中实现低延迟决策。一致性政策通过强制遵循扩散政策所学习轨迹的自我一致性,从预训练的扩散政策中蒸馏而来。我们在6个仿真任务以及三个真实世界任务中将一致性政策与扩散政策和其他相关加速方法进行比较,并在笔记本电脑 GPU 上进行推理。对于所有这些任务,一致性政策的推断速度比最快的替代方法快一个数量级,并且保持了竞争的成功率。我们还显示,一致性政策的训练程序对预训练扩散政策的质量具有鲁棒性,这一结果对于帮助从业者避免对预训练模型进行大量测试具有重要意义。启用这种性能的关键设计决策包括一致性目标的选择、初始样本方差的降低以及预设链式步骤的选择。
引用
@article{arxiv.2405.07503,
title = {Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation},
author = {Aaditya Prasad and Kevin Lin and Jimmy Wu and Linqi Zhou and Jeannette Bohg},
journal= {arXiv preprint arXiv:2405.07503},
year = {2024}
}
备注
https://consistency-policy.github.io/