中文

复杂流中微型游泳器导航的强化学习方法批判性评估

机器学习 2025-10-28 v2 流体动力学

摘要

在流体中被携带的同时仅利用 onboard 传感器可获取的信息进行导航,是小型浮游生物普遍面临的问题。这也与部署在海洋中的自主机器人直接相关。过去十年中,流体力学界广泛采用了强化学习,通常以最简单的实现形式,来应对这一挑战。但这些算法学到的策略究竟如何尚不清楚。本文对应用于部分可观测流中导航的强化学习方法进行了定量评估。我们首先引入一个定义良好的方向导航问题,该问题的准最优策略已知可解析求得。然后我们报告了常用算法(Q-Learning、Advantage Actor Critic)在文献中常见流场——Taylor-Green涡、Arnold-Beltrami-Childress流和二维湍流——中的表现不佳和鲁棒性差。我们表明,它们被PPO(Proximal Policy Optimization)大幅超越,后者是一种更先进的算法,已在强化学习社区的广泛基准测试中确立了主导地位。特别是,我们对PPO的自定义实现匹配了湍流中的理论准最优性能,并以鲁棒的方式实现。达到这一结果需要使用若干额外技术,如向量化环境和广义优势估计,以及超参数优化。本研究强调了算法选择、实现细节和精细调优对于在复杂流中发现真正智能的自主导航策略的重要性。

关键词

引用

@article{arxiv.2505.05525,
  title  = {A critical assessment of reinforcement learning methods for microswimmer navigation in complex flows},
  author = {Selim Mecanna and Aurore Loisy and Christophe Eloy},
  journal= {arXiv preprint arXiv:2505.05525},
  year   = {2025}
}