中文

部分可观测 Atari 游戏中的无监督表示学习

机器学习 2023-03-15 v1 人工智能

摘要

状态表示学习旨在捕捉环境的潜在因素。在以往的状态表示学习研究中,对比方法的性能优于生成模型。尽管一些研究者意识到掩码图像建模与对比表示学习之间的联系,但这些工作集中于使用掩码作为增强技术以更好地表示潜在生成因素。强化学习中的部分可观测环境尚未使用无监督状态表示学习方法进行仔细研究。在本文中,我们为部分可观测状态创建了一种无监督状态表示学习方案。我们在先前为评估表示学习模型而设计的 Atari 2600 框架上进行了实验。一种称为时空 DeepInfomax (ST-DIM) 的对比方法在该基准上展示了最先进的性能,但仍逊于其有监督对应方法。我们的方法在环境非完全可观测时改进了 ST-DIM,并取得了比有监督学习对应方法更高的 F1 分数和准确率分数。我们的方法在各类别上平均的准确率均值约为 66%,而有监督学习约为 38%。F1 分数均值约为 64% 对比约 33%。

关键词

引用

@article{arxiv.2303.07437,
  title  = {Unsupervised Representation Learning in Partially Observable Atari Games},
  author = {Li Meng and Morten Goodwin and Anis Yazidi and Paal Engelstad},
  journal= {arXiv preprint arXiv:2303.07437},
  year   = {2023}
}