中文

基于期望最大化潜变量建模的多智能体强化学习用于无人机野生动物保护

机器学习 2025-10-13 v2 人工智能

摘要

保护濒危野生动物免受非法偷猎是一项严峻的挑战,尤其是在广阔且部分可观测的环境中,实时响应至关重要。本文介绍了一种新颖的基于期望最大化(EM)的潜变量建模方法,应用于多智能体强化学习(MARL)框架下的无人机(UAV)协调野生动物保护。通过潜变量对隐藏的环境因素和智能体间动态进行建模,我们的方法增强了不确定性下的探索和协调。我们使用一个包含10架无人机巡逻濒危伊朗豹保护栖息地的定制模拟来实施和评估我们的EM-MARL框架。大量的实验结果表明,与标准算法如近端策略优化(PPO)和深度确定性策略梯度(DDPG)相比,我们的方法在检测精度、适应性和策略收敛性方面表现出更优的性能。我们的研究结果强调了将EM推理与MARL相结合以改善复杂、高风险保护场景中分散决策的潜力。完整的实现、模拟环境和训练脚本已在GitHub上公开。

关键词

引用

@article{arxiv.2509.02579,
  title  = {Latent Variable Modeling in Multi-Agent Reinforcement Learning via Expectation-Maximization for UAV-Based Wildlife Protection},
  author = {Mazyar Taghavi and Rahman Farnoosh},
  journal= {arXiv preprint arXiv:2509.02579},
  year   = {2025}
}