中文

极小极大模型学习

机器学习 2021-03-04 v1 人工智能 机器人学

摘要

我们提出了一种用于基于模型的强化学习中学习转移模型的新颖离屏损失函数。值得注意的是,我们的损失源自离屏策略评估目标,重点在于纠正分布偏移。与以往的基于模型技术相比,我们的方法在模型误设定或由学习与评估不同于数据生成策略的策略所引起的分布偏移下具有更强的鲁棒性。我们提供了理论分析,并展示了相对于现有基于模型的离屏策略评估方法的经验改进。我们进一步分析表明,我们的损失可用于离屏优化(OPO),并展示了其与近期 OPO 改进的集成。

关键词

引用

@article{arxiv.2103.02084,
  title  = {Minimax Model Learning},
  author = {Cameron Voloshin and Nan Jiang and Yisong Yue},
  journal= {arXiv preprint arXiv:2103.02084},
  year   = {2021}
}