面向随机、稀疏与非平稳环境的自动潜水车污染检测强化学习
机器学习
2025-10-31 v1 人工智能
摘要
强化学习(RL)算法旨在通过学习最大化奖励的动作序列来优化问题解决,这在随机和非平稳环境中尤为具有挑战性。尽管已有先进的 RL 算法,但往往受限于其在此类条件下解决问题的能力。在潜水车搜索潜在污染云的应用中,RL 算法必须在奖励稀疏的环境中导航,动作常常仅导致零奖励。本文旨在通过重新审视和修改经典 RL 方法,以高效地在稀疏、随机和非平稳环境中运行。我们系统性地研究了大量修改,包括层次化算法变更、多目标学习以及集成位置记忆作为外部过滤器以防止状态重复访问。我们的结果表明,修改后的蒙特卡罗基于方法在对比传统 Q 学习和两种穷举搜索模式时显著优于后者,说明其在复杂环境中的适应潜力。这些发现表明,强化学习方法可以被有效地适应用于随机、非平稳和奖励稀疏环境中。
引用
@article{arxiv.2510.26347,
title = {Reinforcement Learning for Pollution Detection in a Randomized, Sparse and Nonstationary Environment with an Autonomous Underwater Vehicle},
author = {Sebastian Zieglmeier and Niklas Erdmann and Narada D. Warakagoda},
journal= {arXiv preprint arXiv:2510.26347},
year = {2025}
}