基于 Stackelberg proximal policy optimization 的高效形态-控制协同设计
摘要
形态-控制协同设计关注智能体身体结构与控制策略的耦合优化。该问题呈现双层结构,其中控制策略动态适应形态以最大化性能。现有方法通常忽略控制的适应动力学,采用将控制策略在优化形态时视为固定的单层表述。这可能导致优化效率低下,因为形态更新可能与控制适应不一致。在本文中,我们从博弈论视角重新审视协同设计问题,将形态与控制之间的内在耦合建模为一种新型 Stackelberg 博弈。我们提出 Stackelberg Proximal Policy Optimization(Stackelberg PPO),将控制的适应动力学显式纳入形态优化。通过建模这种内在耦合,我们的方法使形态更新与控制适应保持一致,从而稳定训练并提升学习效率。跨多种协同设计任务的实验表明,Stackelberg PPO 在稳定性和最终性能方面均优于标准 PPO,为更高效的机器人设计开辟了道路。
引用
@article{arxiv.2603.15388,
title = {Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization},
author = {Yanning Dai and Yuhui Wang and Dylan R. Ashley and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2603.15388},
year = {2026}
}
备注
presented at the Fourteenth International Conference on Learning Representations; 11 pages in main text + 3 pages of references + 23 pages of appendices, 5 figures in main text + 11 figures in appendices, 16 tables in appendices; accompanying website available at https://yanningdai.github.io/stackelberg-ppo-co-design/ ; source code available at https://github.com/YanningDai/StackelbergPPO