快速学习 6 自由度 位控的 underwater 车辆策略
机器人学
2026-02-03 v2 机器学习
摘要
自主水下车辆(AUV)需要可靠的六自由度(6-DOF)位置控制才能在复杂和动态的海洋环境中有效运行。传统控制器在名义条件下有效,但在面临未建模动力学或环境扰动时表现下降。强化学习(RL)提供了强大的替代方案,但训练通常缓慢且仿真到现实的迁移仍具有挑战性。本工作引入了基于 JAX 和 MuJoCo-XLA(MJX)构建的 GPU 加速 RL 训练管道。通过联合即时编译大规模并行物理仿真和学习更新,我们实现了训练时间不到两分钟。通过对多种 RL 算法进行系统评估,我们展示在真实水下实验中实现了稳健的 6-DOF 轨迹跟踪和有效的扰动抑制,策略可从仿真零样本迁移。
引用
@article{arxiv.2512.13359,
title = {Fast Policy Learning for 6-DOF Position Control of Underwater Vehicles},
author = {Sümer Tunçay and Alain Andres and Ignacio Carlucho},
journal= {arXiv preprint arXiv:2512.13359},
year = {2026}
}