基于对比随机游走发现内在奖励
机器学习
2022-04-26 v1 人工智能
摘要
本文旨在证明使用对比随机游走(Contrastive Random Walk)作为好奇心方法以实现更快收敛到最优策略的有效性。对比随机游走借助神经网络定义随机游走的转移矩阵,它通过闭环学习有意义的状态表示。对比随机游走的损失作为内在奖励,被加到环境奖励上。我们的方法在非表格稀疏奖励场景中表现良好,即在相同迭代次数内相比其他方法获得最高奖励。同时,对比随机游走更具鲁棒性,其性能在不同环境随机初始化下变化不大。我们还发现自适应重启和适当的温度对对比随机游走的性能至关重要。
引用
@article{arxiv.2204.10976,
title = {Discovering Intrinsic Reward with Contrastive Random Walk},
author = {Zixuan Pan and Zihao Wei and Yidong Huang and Aditya Gupta},
journal= {arXiv preprint arXiv:2204.10976},
year = {2022}
}
备注
9 pages, 6 figures