中文

HALyPO:面向人机协作的异构智能体Lyapunov政策优化

机器人学 2026-03-05 v1 人工智能

摘要

为提升人机协作(HRC)中的泛化能力与韧性,机器人必须处理人类行为与情境组合爆炸式的多样性,这驱动了多智能体强化学习(MARL)。然而,机器人与人类之间固有的异构性在学习过程中导致理性差距(RG)——即去中心化最佳响应动力学与集中化合作上升之间的变分失配。由此产生的学习问题是一般和型可微游戏,独立的政策梯度更新若无额外结构将导致振荡或发散。我们提出异构智能体Lyapunov政策优化(HALyPO),通过强制执行参数空间内的每一步Lyapunov递减条件,建立政策参数空间中的形式稳定性。不同于面向状态/轨迹约束的Lyapunov安全强化学习,HALyPO利用Lyapunov认证来稳定去中心化政策学习。HALyPO通过最优二次投影校正去中心化梯度,确保RG的单调收缩,并使探索开放式交互空间有效化。大量仿真与实际人形机器人实验表明,此认证稳定性显著提升了协作边界情况下的泛化能力与鲁棒性。

关键词

引用

@article{arxiv.2603.03741,
  title  = {HALyPO: Heterogeneous-Agent Lyapunov Policy Optimization for Human-Robot Collaboration},
  author = {Hao Zhang and Yaru Niu and Yikai Wang and Ding Zhao and H. Eric Tseng},
  journal= {arXiv preprint arXiv:2603.03741},
  year   = {2026}
}