中文

基于模型的强化学习中 Wasserstein 距离与价值感知损失的等价性

机器学习 2018-07-10 v2 人工智能 机器学习

摘要

学习生成模型是基于模型的强化学习的关键组成部分。尽管在表格环境下学习一个好模型是简单任务,在近似环境下学习有用模型却具挑战性。在此背景下,一个重要问题是模型学习所用的损失函数,因为改变损失函数会对规划的有效性产生显著影响。最近 Farahmand 等人(2017)提出了一种价值感知模型学习(VAML)目标,在模型学习过程中捕捉价值函数的结构。利用 Asadi 等人(2018)的工具,我们证明最小化 VAML 目标实际上等价于最小化 Wasserstein 度量。该等价性增进了我们对价值感知模型的理解,也为 Wasserstein 距离在基于模型的强化学习中的应用奠定了理论基础。

关键词

引用

@article{arxiv.1806.01265,
  title  = {Equivalence Between Wasserstein and Value-Aware Loss for Model-based Reinforcement Learning},
  author = {Kavosh Asadi and Evan Cater and Dipendra Misra and Michael L. Littman},
  journal= {arXiv preprint arXiv:1806.01265},
  year   = {2018}
}

备注

Accepted at the FAIM workshop "Prediction and Generative Modeling in Reinforcement Learning", Stockholm, Sweden, 2018