InfoBot:基于信息瓶颈的迁移与探索
机器学习
2023-12-07 v5 机器学习
摘要
强化学习中的一个核心挑战是为奖励稀疏分布的任务发现有效策略。我们假定在缺乏有用奖励信号时,有效的探索策略应寻找决策状态。这些状态位于状态空间中的关键节点,智能体可由此过渡到新的、潜在未探索区域。我们提议从先验经验中学习决策状态。通过训练带信息瓶颈的目标条件策略,我们可通过考察模型实际利用目标状态的位置来识别决策状态。我们发现这一简单机制能有效识别决策状态,即使在部分可观测设定下亦然。实质上,模型学习了与潜在子目标相关的感官线索。在新环境中,该模型随后可识别新颖子目标以进一步探索,引导智能体穿越一系列潜在决策状态及状态空间的新区域。
引用
@article{arxiv.1901.10902,
title = {InfoBot: Transfer and Exploration via the Information Bottleneck},
author = {Anirudh Goyal and Riashat Islam and Daniel Strouse and Zafarali Ahmed and Matthew Botvinick and Hugo Larochelle and Yoshua Bengio and Sergey Levine},
journal= {arXiv preprint arXiv:1901.10902},
year = {2023}
}
备注
Accepted at ICLR'19