非对称范数近似最小动作距离
机器学习
2023-12-20 v2
摘要
本文提出了一种用于无奖励马尔可夫决策过程的状态表示。其思想是以自监督方式学习一个嵌入空间,其中嵌入状态对之间的距离对应于在它们之间转换所需的最小动作数。与以往方法不同,我们的方法引入了非对称范数参数化,从而能够在具有内在不对称性的环境中精确近似最小动作距离。我们展示了如何利用这种表示来学习目标条件策略,提供状态与目标之间的相似性概念以及用于指导规划的有用启发式距离。为了验证我们的方法,我们在对称和非对称环境中进行了实证实验。结果表明,我们的非对称范数参数化在对称环境中与对称范数表现相当,在非对称环境中则优于对称范数。
引用
@article{arxiv.2312.10276,
title = {Asymmetric Norms to Approximate the Minimum Action Distance},
author = {Lorenzo Steccanella and Anders Jonsson},
journal= {arXiv preprint arXiv:2312.10276},
year = {2023}
}