基于广义图绘制的强化学习更优拉普拉斯表示
机器学习
2021-07-13 v1 人工智能
机器学习
摘要
拉普拉斯表示近期在强化学习中受到越来越多的关注,因为它通过取状态转移图的拉普拉斯矩阵的特征向量作为状态嵌入,为状态提供了简洁且信息丰富的表示。这种表示捕捉了底层状态空间的几何结构,并有益于如选项发现和奖励塑形等 RL 任务。为了在大型(甚至连续)状态空间中近似拉普拉斯表示,近期工作提出最小化谱图绘制目标,然而该目标除特征向量外还有无穷多个全局极小点。因此,它们学到的拉普拉斯表示可能与真实值不同。为解决此问题,我们将图绘制目标重新表述为广义形式,并推导出一个新的学习目标,该目标被证明以特征向量作为其唯一的全局极小点。它使得学习能忠实近似真实值的高质量拉普拉斯表示成为可能。我们在一组网格世界和连续控制环境上的综合实验验证了这个结论。此外,我们表明我们学到的拉普拉斯表示能带来更具探索性的选项和更好的奖励塑形。
引用
@article{arxiv.2107.05545,
title = {Towards Better Laplacian Representation in Reinforcement Learning with Generalized Graph Drawing},
author = {Kaixin Wang and Kuangqi Zhou and Qixin Zhang and Jie Shao and Bryan Hooi and Jiashi Feng},
journal= {arXiv preprint arXiv:2107.05545},
year = {2021}
}
备注
ICML 2021