释放表征在长期基于新颖性探索中的力量
机器学习
2023-05-03 v1 机器学习
摘要
我们提出鲁棒探索 via 基于聚类的在线密度估计(RECODE),一种基于新颖性探索的非参数方法,根据所选嵌入空间中的相似性估计状态簇的访问次数。通过将经典聚类适配到深度强化学习的非平稳设定,RECODE 能高效跟踪数千回合中的状态访问次数。我们进一步提出逆动力学损失的一种新颖泛化,利用掩码 transformer 架构进行多步预测;其与 RECODE 结合在 DM-Hard-8 的一系列具有挑战性的 3D 探索任务中达到新的 SOTA。RECODE 也在困难探索的 Atari 游戏中创下新 SOTA,并且是首个在“Pitfall!”中到达结束画面的智能体。
引用
@article{arxiv.2305.01521,
title = {Unlocking the Power of Representations in Long-term Novelty-based Exploration},
author = {Alaa Saade and Steven Kapturowski and Daniele Calandriello and Charles Blundell and Pablo Sprechmann and Leopoldo Sarra and Oliver Groth and Michal Valko and Bilal Piot},
journal= {arXiv preprint arXiv:2305.01521},
year = {2023}
}