中文

面向数据高效强化学习的无监督显著图像块选择

计算机视觉与模式识别 2024-02-07 v1 人工智能

摘要

为了提高基于视觉的深度强化学习(RL)的样本效率,我们提出了一种名为 SPIRL 的新方法,用于从输入图像中自动提取重要的图像块。遵循掩码自编码器的思路,SPIRL 基于以自监督方式预训练的视觉Transformer模型,这些模型通过随机采样的图像块来重建图像。这些预训练模型随后可被用于检测和选择显著图像块,显著图像块被定义为难以从相邻图像块重建的图像块。在强化学习中,SPIRL 智能体通过一个注意力模块处理所选的显著图像块。我们在 Atari 游戏上对 SPIRL 进行了实证验证,测试其相对于相关最先进方法(包括一些传统的基于模型的方法和基于关键点的模型)的数据效率。此外,我们还分析了我们模型的可解释性能力。

关键词

引用

@article{arxiv.2402.03329,
  title  = {Unsupervised Salient Patch Selection for Data-Efficient Reinforcement Learning},
  author = {Zhaohui Jiang and Paul Weng},
  journal= {arXiv preprint arXiv:2402.03329},
  year   = {2024}
}