中文

恰当的拉普拉斯表示学习

机器学习 2024-04-04 v2 人工智能

摘要

学习良好的状态表示的能力对于解决大型强化学习问题至关重要,其中探索、泛化和迁移尤其具有挑战性。拉普拉斯表示是一种有前景的方法,通过诱导信息性状态编码以及用于时间扩展动作发现和奖励塑形的内在奖励来解决这些问题。为获得拉普拉斯表示,需要计算图拉普拉斯的特征系统,这通常通过兼容深度学习方法的优化目标来近似。然而,这些近似依赖于无法高效调优的超参数,收敛到所需特征向量的任意旋转,且无法准确恢复相应特征值。本文中,我们引入一个理论可靠的目标及相应的优化算法来近似拉普拉斯表示。我们的方法自然恢复真实特征向量与特征值,同时消除先前近似的超参数依赖性。我们为方法提供理论保证,并展示这些结果在经验上转化为跨多个环境的鲁棒学习。

关键词

引用

@article{arxiv.2310.10833,
  title  = {Proper Laplacian Representation Learning},
  author = {Diego Gomez and Michael Bowling and Marlos C. Machado},
  journal= {arXiv preprint arXiv:2310.10833},
  year   = {2024}
}