中文

面向鲁棒自监督探索的动态瓶颈

机器学习 2021-10-26 v2 人工智能

摘要

基于转移伪计数或动态好奇心的探索方法在解决稀疏奖励的强化学习问题中取得了有前景的结果。然而,这类方法通常对与环境动态无关的信息(例如白噪声)敏感。为处理此类动态无关信息,我们提出了动态瓶颈(Dynamic Bottleneck, DB)模型,该模型基于信息瓶颈原理获得动态相关表示。基于 DB 模型,我们进一步提出 DB-bonus,鼓励智能体探索具有高信息增益的状态-动作对。我们建立了所提 DB-bonus、线性情形下的上置信界(UCB)以及表格情形下的访问计数之间的理论联系。我们在带有动态无关噪声的 Atari 套件上评估了所提方法。实验表明,在噪声环境中,使用 DB bonus 的探索优于多种最先进的探索方法。

关键词

引用

@article{arxiv.2110.10735,
  title  = {Dynamic Bottleneck for Robust Self-Supervised Exploration},
  author = {Chenjia Bai and Lingxiao Wang and Lei Han and Animesh Garg and Jianye Hao and Peng Liu and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2110.10735},
  year   = {2021}
}

备注

NeurIPS 2021