中文

得分与分布匹配策略:通过匹配蒸馏实现高级加速视觉-运动策略

机器人学 2024-12-20 v4 机器学习 机器学习

摘要

视觉-运动策略学习通过扩散策略等架构取得了进展,这类架构擅长建模复杂的机器人轨迹。然而,他们的推理时间较长,难以满足需要实时反馈的高频控制任务。虽然一致性蒸馏(CD)可加速推理,但会引入错误,影响动作质量。为此,我们提出了得分与分布匹配策略(SDM Policy),通过两个阶段的优化过程将扩散策略转化为单步生成器:得分匹配确保与真实动作分布对齐,分布匹配最小化KL散度以实现一致性。一种双教师机制集成了用于稳定性的冻结教师和用于对抗训练的非冻结教师,增强了鲁棒性和与目标分布的一致性。在57个任务的仿真基准测试中,SDM Policy实现了6倍的推理加速,同时达到了最好的动作质量,为高频机器人任务提供了高效可靠的框架。

关键词

引用

@article{arxiv.2412.09265,
  title  = {Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation},
  author = {Bofang Jia and Pengxiang Ding and Can Cui and Mingyang Sun and Pengfang Qian and Siteng Huang and Zhaoxin Fan and Donglin Wang},
  journal= {arXiv preprint arXiv:2412.09265},
  year   = {2024}
}