面向分散式主动假设检验的深度多智能体强化学习
机器学习
2023-09-18 v1 机器学习
多智能体系统
信号处理
摘要
我们考虑主动假设检验(AHT)问题的分散式表述,其中多个智能体从环境中收集含噪观测以识别正确假设。每步智能体可选择采样动作。这些不同动作产生取自各分布的观测,每个分布关联一特定假设。智能体协作完成任务,智能体间允许在速率受限通信信道上交换消息。目标是设计使 Bayes 风险最小的多智能体策略。该风险包含采样成本及智能体作假设声明时的联合终止成本。推导 AHT 问题的最优结构化策略通常数学上不可解,即便在单智能体情形下亦如此。因此,近期研究转向深度学习方法来解决此类问题,其在单智能体学习场景中已展现显著成功。本文通过引入根植于深度多智能体强化学习框架的新算法来处理多智能体 AHT 表述。该算法名为 MARLA(用于 AHT 的多智能体强化学习),每步让各智能体使用训练好的深度神经网络将其状态映射至动作(采样规则或停止规则),以最小化 Bayes 风险。我们给出全面实验结果,有效展示智能体使用 MARLA 学习协作策略并提升性能的能力。此外,我们证明 MARLA 优于单智能体学习方法。最后,我们提供 MARLA 框架的开源实现,以惠及相关领域的研究人员与开发者。
引用
@article{arxiv.2309.08477,
title = {Deep Multi-Agent Reinforcement Learning for Decentralized Active Hypothesis Testing},
author = {Hadar Szostak and Kobi Cohen},
journal= {arXiv preprint arXiv:2309.08477},
year = {2023}
}
备注
A short version of this paper was presented at the annual Allerton Conference on Communication, Control, and Computing (Allerton) 2022