面向可扩展机器人控制的在线扩散政策 RL 算法综述
机器学习
2026-02-10 v2 人工智能
机器人学
摘要
扩散政策作为一种强大的机器人控制方法,展示出在建模多模态动作分布方面优于常规策略网络的表达能力。然而,其与在线强化学习的集成仍面临挑战,due to diffusion model training objectives 与标准 RL 策略改进机制之间的根本性不兼容。本文提供了当前在线扩散政策强化学习(Online DPRL)算法的首个全面综述与实证分析,面向可扩展机器人控制系统。我们提出了一种新型分类法,将现有方法基于其策略改进机制划分为四个 distinct family——Action-Gradient、Q-Weighting、Proximity-Based 和 Backpropagation Through Time(BPTT)方法。通过在统一的 NVIDIA Isaac Lab 框架下进行包含 12 个多样化机器人任务的广泛实验,我们系统评估了代表性算法在五个关键维度:任务多样性、并行化能力、扩散步数可扩展性、跨 embodiment 泛化以及环境鲁棒性。我们的分析识别出每种算法 family 所固有的关键权衡,特别是关于样本效率和可扩展性。此外,我们揭示了限制在线 DPRL 实际部署的关键计算和算法瓶颈。基于这些发现,我们提供了针对特定操作约束的算法选择指南,并概述了推动该领域向更通用和可扩展的机器人学习系统发展的前景研究方向。
引用
@article{arxiv.2601.06133,
title = {A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control},
author = {Wonhyeok Choi and Shutong Ding and Minwoo Choi and Jungwan Woo and Kyumin Hwang and Jaeyeul Kim and Ye Shi and Sunghoon Im},
journal= {arXiv preprint arXiv:2601.06133},
year = {2026}
}