中文

从无向纯状态经验中学习价值函数

机器学习 2022-04-27 v1 人工智能 机器人学

摘要

本文解决从无向纯状态经验(即无动作标签的状态转移 (s,s',r) 元组)中学习价值函数的问题。我们首先从理论上刻画了 Q-learning 在此设定下的适用性。我们证明,在离散马尔可夫决策过程(MDP)中,表格型 Q-learning 在动作空间的任意细化下都能学到相同的价值函数。这一理论结果启发了潜在动作 Q-learning(Latent Action Q-learning, LAQ)的设计,这是一种能够从纯状态经验中学习有效价值函数的离线强化学习方法。潜在动作 Q-learning(LAQ)通过对通过潜在变量未来预测模型获得的离散潜在动作进行 Q-learning 来学习价值函数。我们证明,LAQ 能够恢复出与使用真实动作学得的价值函数具有高相关性的价值函数。使用 LAQ 学得的价值函数能够实现样本高效的目标导向行为获取,可与特定领域的低级控制器结合使用,并促进跨具身形态的迁移。我们在从 2D 网格世界到逼真环境中 3D 视觉导航的 5 个环境中的实验,展示了 LAQ 相较于更简单的替代方案、模仿学习基准以及竞争方法的优势。

关键词

引用

@article{arxiv.2204.12458,
  title  = {Learning Value Functions from Undirected State-only Experience},
  author = {Matthew Chang and Arjun Gupta and Saurabh Gupta},
  journal= {arXiv preprint arXiv:2204.12458},
  year   = {2022}
}

备注

ICLR 2022. Project website at https://matthewchang.github.io/latent_action_qlearning_site