中文

MIMEx:基于掩码输入建模的内在奖励

机器学习 2023-05-17 v1 人工智能

摘要

在高维观测环境中探索是困难的。一种有前景的探索方法是使用内在奖励,这通常归结为用深度网络估计状态、转移或轨迹的“新颖性”。先前工作表明,诸如掩码自编码的条件预测目标可被视为伪似然的随机估计。我们展示了这一视角如何自然导出对现有内在奖励方法的统一看法:它们是条件预测的特殊情况,其中新颖性的估计可视为具有不同掩码分布的伪似然估计。由此视角,我们提出了一个推导内在奖励的通用框架——用于探索的掩码输入建模(MIMEx)——其中掩码分布可灵活调节以控制底层条件预测任务的难度。我们证明,在一系列具有挑战性的稀疏奖励视觉运动任务上,MIMEx相比有竞争力的基线可取得更优结果。

关键词

引用

@article{arxiv.2305.08932,
  title  = {MIMEx: Intrinsic Rewards from Masked Input Modeling},
  author = {Toru Lin and Allan Jabri},
  journal= {arXiv preprint arXiv:2305.08932},
  year   = {2023}
}

备注

Code available at https://github.com/ToruOwO/mimex