中文

基于拟度量学习的最优目标到达强化学习

机器学习 2023-11-28 v7

摘要

在目标到达强化学习(RL)中,最优值函数具有一种特定的几何结构,称为拟度量结构。本文提出拟度量强化学习(QRL),一种利用拟度量模型来学习最优值函数的新RL方法。与先前方法不同,QRL目标函数专为拟度量设计,并提供强理论恢复保证。在经验上,我们在一个离散化MountainCar环境上进行了透彻分析,明确了QRL的性质及其相对于替代方法的优势。在离线与在线目标到达基准上,QRL在基于状态与基于图像的观测下均展现出更高的采样效率与性能。

关键词

引用

@article{arxiv.2304.01203,
  title  = {Optimal Goal-Reaching Reinforcement Learning via Quasimetric Learning},
  author = {Tongzhou Wang and Antonio Torralba and Phillip Isola and Amy Zhang},
  journal= {arXiv preprint arXiv:2304.01203},
  year   = {2023}
}

备注

Project Page: https://www.tongzhouwang.info/quasimetric_rl/ Code: https://github.com/quasimetric-learning/quasimetric-rl/