利用状态的序列性质学习强化学习的特征
机器学习
2022-05-13 v1 计算机视觉与模式识别
摘要
在这项工作中,我们研究了导致流行的表示学习方法失效的数据特性。特别是,我们发现在状态没有显著重叠的环境中,变分自编码器(VAEs)无法学习到有用的特征。我们在一个简单的网格世界域中展示了这种失败,然后以度量学习的形式提供了一种解决方案。然而,度量学习需要以距离函数的形式进行监督,而这在强化学习中是不存在的。为了克服这一点,我们利用回放缓冲区中状态的序列性质来近似距离度量,并在时间上接近的状态在语义上也相似的假设下,提供一种弱监督信号。我们使用三元组损失修改了 VAE,并证明这种方法能够在标准 VAE 失效的环境中,无需额外监督即可为下游任务学习到有用的特征。
引用
@article{arxiv.2205.06000,
title = {Accounting for the Sequential Nature of States to Learn Features for Reinforcement Learning},
author = {Nathan Michlo and Devon Jarvis and Richard Klein and Steven James},
journal= {arXiv preprint arXiv:2205.06000},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2202.13341