基于 MDP 同态度量的低维状态与动作表示学习
机器学习
2021-07-06 v1 人工智能
摘要
深度强化学习已展现出直接从高维观测中解决复杂问题的能力。然而,在端到端设定下,强化学习算法样本效率低下,需要较长的训练时间和大量数据。在这项工作中,我们提出了一个样本高效的强化学习框架,该框架利用状态与动作表示将高维问题转化为低维问题。此外,我们寻求找到将潜在状态映射到潜在动作的最优策略。由于该策略现在是在抽象表示上学习的,我们使用辅助损失函数强制将该策略提升回原始问题域。结果表明,该新颖框架能够高效学习低维且可解释的状态与动作表示以及最优潜在策略。
引用
@article{arxiv.2107.01677,
title = {Low-Dimensional State and Action Representation Learning with MDP Homomorphism Metrics},
author = {Nicolò Botteghi and Mannes Poel and Beril Sirmacek and Christoph Brune},
journal= {arXiv preprint arXiv:2107.01677},
year = {2021}
}