中文

基于扩散模型预测控制的灵活足端 locomotion 学习

机器人学 2025-10-07 v1 人工智能

摘要

足端 locomotion 需要控制器具备鲁棒性和适应性,同时与任务和安全性考虑相兼容。然而,模型无关强化学习方法往往产生固定策略,难以在测试时适应新的行为。相比之下,模型预测控制 (MPC) 通过将不同的目标和约束直接纳入优化过程,提供了灵活行为合成的自然方法。然而,经典 MPC 依赖于准确的动力学模型,而在复杂环境中往往难以获得,通常需要做出简化假设。我们提出了 Diffusion-MPC,该方法利用学习生成式扩散模型作为规划的近似动力学先验,实现通过奖励和约束基于优化的灵活测试时适应。Diffusion-MPC 联合预测未来状态和动作;在每个反向步骤中,我们融入奖励规划并施加约束投影,生成满足任务目标且在物理限制范围内的轨迹。为获得超越模仿预训练的规划模型,我们引入了一种用于扩散基于规划器的交互式训练算法:我们在环境中执行奖励-约束规划器,然后根据实现的回报对收集的轨迹进行筛选和重加权,再更新去噪器。我们的设计实现了强大的测试时适应性,使规划器能够在无需重新训练的情况下调整以新的奖励规范。我们在真实世界环境中验证了 Diffusion-MPC,展示了强大的 locomotion 能力和灵活的适应性。

关键词

引用

@article{arxiv.2510.04234,
  title  = {Flexible Locomotion Learning with Diffusion Model Predictive Control},
  author = {Runhan Huang and Haldun Balim and Heng Yang and Yilun Du},
  journal= {arXiv preprint arXiv:2510.04234},
  year   = {2025}
}

备注

9 pages, 8 figures