学习协调:通过可微 ADMM-DDP 实现分布式元轨迹优化
机器学习
2025-09-08 v2 多智能体系统
机器人学
系统与控制
系统与控制
摘要
通过 ADMM-DDP 实现的分布式轨迹优化是一种强大的多代理系统协调方法,但需要对紧密耦合的超参数进行大量调谐,这些超参数共同决定局部任务性能和全局协调。在本文中,我们提出 Learning to Coordinate (L2C),一个通用的框架,通过元学习这些超参数——建模为轻量级代理相关神经网络——以适应不同任务和代理配置。L2C 在分布式 manner 下对 ADMM-DDP 流程进行端到端微分。它还通过复用 DDP 组件如 Riccati 递归和反馈增益实现高效的元梯度计算。这些梯度对应分布式矩阵值 LQR 问题的最优解,通过一个辅助 ADMM 框架在代理之间协调,该框架在温和假设下变为凸问题。进一步通过截断迭代和元学习 ADMM 惩罚参数来加速训练,以实现快速残差减少,具有可证明的 Lipschitz 有界梯度误差。在一项具有挑战性的合作空中运输任务中,L2C 使用 IsaacSIM 在高保真仿真中生成动态可行轨迹,重新配置四旋翼机编队以安全地在狭小空间中进行 6 自由度负载操纵,并且能够适应不同队规和任务条件,同时实现最先进方法的 88% 速度提升。
引用
@article{arxiv.2509.01630,
title = {Learning to Coordinate: Distributed Meta-Trajectory Optimization Via Differentiable ADMM-DDP},
author = {Bingheng Wang and Yichao Gao and Tianchen Sun and Lin Zhao},
journal= {arXiv preprint arXiv:2509.01630},
year = {2025}
}