中文

具有连续潜在动力学的丰富观测强化学习

机器学习 2024-05-30 v1

摘要

样本效率和可靠性仍然是强化学习算法在具有高维感知输入的连续设置中广泛采用的主要瓶颈。为了解决这些挑战,我们引入了一个新的理论框架RichCLD(具有连续潜在动力学的丰富观测强化学习),其中智能体基于高维观测进行控制,但环境由低维潜在状态和Lipschitz连续动力学支配。我们的主要贡献是针对该设置的一个新算法,该算法在统计和计算上被证明是高效的。我们算法的核心是一个新的表示学习目标;我们表明,先前针对离散动力学定制的表示学习方案不能自然地扩展到连续设置。我们的新目标适用于实际实现,并且在经验上,我们发现它在标准评估协议中优于先前的方案。我们进一步提供了关于RichCLD框架统计复杂性的若干见解,特别是证明了在缺乏丰富观测的情况下允许样本高效学习的某些Lipschitz性质在丰富观测设置中是不够的。

关键词

引用

@article{arxiv.2405.19269,
  title  = {Rich-Observation Reinforcement Learning with Continuous Latent Dynamics},
  author = {Yuda Song and Lili Wu and Dylan J. Foster and Akshay Krishnamurthy},
  journal= {arXiv preprint arXiv:2405.19269},
  year   = {2024}
}

备注

63 pages, 4 figures, published at ICML 2024