中文

面向深度强化学习 POMDP 基准的 Mask Atari

计算机视觉与模式识别 2022-04-01 v1 人工智能 机器学习

摘要

我们提出 Mask Atari,一个用于借助基于深度强化学习 (DRL) 的方法求解部分可观测马尔可夫决策过程 (POMDP) 问题的新基准。为构建 POMDP 问题的仿真环境,Mask Atari 基于 Atari 2600 游戏构建,以可控、可移动且可学习的掩码作为目标智能体的观测区域,尤其适配 POMDP 中的主动信息收集 (AIG) 设定。鉴于此类基准尚不存在,Mask Atari 为评估专注于上述问题的方法提供了一个兼具挑战性与高效性的基准。此外,掩码操作是将人类视觉系统中的感受野引入智能体仿真环境的一种尝试,这意味着评估不会受感知能力偏差影响,而能纯粹聚焦于方法相对于人类基线的认知表现。我们描述了该基准的挑战与特性,并使用 Mask Atari 对若干基线方法进行了评估。

关键词

引用

@article{arxiv.2203.16777,
  title  = {Mask Atari for Deep Reinforcement Learning as POMDP Benchmarks},
  author = {Yang Shao and Quan Kong and Tadayuki Matsumura and Taiki Fuji and Kiyoto Ito and Hiroyuki Mizuno},
  journal= {arXiv preprint arXiv:2203.16777},
  year   = {2022}
}