中文

受约束下的游泳:四足生物仿生推进的安全强化学习框架

机器人学 2026-03-05 v1

摘要

生物仿生水下推进提供高推力和机动性,但容易受到升力波动等不稳定力的影响,这些力在六自由度(6-DoF)流体耦合下进一步被放大。我们将四足游泳建模为在最大化前向推力的同时最小化不稳定波动的约束优化问题。我们提出的框架Accelerated Constrained Proximal Policy Optimization with a PID-regulated Lagrange multiplier(ACPPO-PID),采用PID调节的拉格朗日乘子施加约束,通过条件非对称裁剪加速学习,通过循环几何聚合稳定更新。初始化为模仿学习,并通过硬件 towing-tank 实验进行细化,ACPPO-PID产生的控制策略能够有效迁移到四足自由游泳试验中。结果表明,与最先进的基线方法相比,ACPPO-PID在推力效率、减小不稳定力和加快收敛速度方面均表现出改进,凸显了在复杂流体环境中对基于约束的安全强化学习对于稳健和可泛化的生物仿生运动的重要性。

关键词

引用

@article{arxiv.2603.04073,
  title  = {Swimming Under Constraints: A Safe Reinforcement Learning Framework for Quadrupedal Bio-Inspired Propulsion},
  author = {Xinyu Cui and Fei Han and Hang Xu and Yongcheng Zeng and Luoyang Sun and Ruizhi Zhang and Jian Zhao and Haifeng Zhang and Weikun Li and Hao Chen and Jun Wang and Dixia Fan},
  journal= {arXiv preprint arXiv:2603.04073},
  year   = {2026}
}