结合深度架构进行信息增益估计与强化学习的多智能体农田探索
机器学习
2025-06-02 v1 人工智能
摘要
精准农业需要高效的自主作物监测系统,其中智能体必须在最小化资源消耗的同时探索大规模环境。本研究将此问题建模为表示农田的网格环境中的主动探索任务。每个单元格可能包含可从九个预定义视点(POV)观察到的目标(例如受损作物)。智能体必须利用部分、序列观测来推断每个单元格中的目标数量。我们提出了一个两阶段深度学习框架。预训练的 LSTM 作为信念模型,更新环境的概率图及其相关熵,从而定义预期信息增益(IG)。这使智能体能够优先处理信息量大的区域。一个关键贡献是在输入中包含 POV 可见性掩码,这在部分可观测下保持了马尔可夫性,并避免重复访问已探索的视点。我们比较了三种智能体架构:一个未经训练的基于 IG 的智能体,选择动作以最大化熵减;一个 DQN 智能体,在带有信念、熵和 POV 掩码的局部 3x3 输入上使用 CNN;以及一个具有更宽空间上下文的 Double-CNN DQN 智能体。在 20x20 地图上的仿真表明,未经训练的智能体尽管简单,但表现良好。当包含 POV 掩码时,DQN 智能体达到了同样的性能,而 Double-CNN 智能体始终实现卓越的探索效率,尤其是在更大的环境中。结果表明,利用熵、信念状态和可见性跟踪的感知不确定性的策略能够带来稳健且可扩展的探索。未来工作包括课程学习、具有共享奖励的多智能体协作、基于 Transformer 的模型以及内在动机机制,以进一步提升学习效率和策略泛化能力。
引用
@article{arxiv.2505.23865,
title = {Combining Deep Architectures for Information Gain estimation and Reinforcement Learning for multiagent field exploration},
author = {Emanuele Masiero and Vito Trianni and Giuseppe Vizzari and Dimitri Ognibene},
journal= {arXiv preprint arXiv:2505.23865},
year = {2025}
}
备注
4 pages, presented at RLDM 2025