中文

第一视角下由评论家引导的奖励物体分割

计算机视觉与模式识别 2021-07-21 v1 人工智能

摘要

本工作讨论一种利用模仿学习数据集中的稀疏奖励信号来掩蔽图像中奖励物体的学习方法。为此,我们仅使用来自评论家模型的反馈训练一个 Hourglass 网络。该 Hourglass 网络学习生成掩码,通过在这两幅图像间交换被掩蔽区域,来降低高评分图像的评论家分数并提升低评分图像的评论家分数。我们在一个来自 NeurIPS 2020 MineRL Competition Track 的模仿学习数据集上训练该模型,其中我们的模型在具有稀疏奖励信号的复杂交互式 3D 环境中学会了掩蔽奖励物体。该方法是该竞赛第一名获胜方案的一部分。视频演示与代码:https://rebrand.ly/critic-guided-segmentation

关键词

引用

@article{arxiv.2107.09540,
  title  = {Critic Guided Segmentation of Rewarding Objects in First-Person Views},
  author = {Andrew Melnik and Augustin Harter and Christian Limberg and Krishan Rana and Niko Suenderhauf and Helge Ritter},
  journal= {arXiv preprint arXiv:2107.09540},
  year   = {2021}
}