中文

DualDICE:与行为无关的对数平稳分布修正估计

机器学习 2019-11-06 v2 人工智能 机器学习

摘要

在许多真实世界的强化学习应用中,对环境的访问仅限于固定数据集,而非与环境的直接(在线)交互。当使用该数据评估或训练新策略时,对数平稳分布比——即量化新策略经历某状态-动作对的可能性除以该状态-动作对出现在数据集中的概率的修正项——的准确估计可提升准确性与性能。本工作中,我们提出一种名为 DualDICE 的算法来估计这些量。与以往方法不同,我们的算法无需知晓用于生成数据集的行为策略(或策略们)。此外,它避免直接使用重要性权重,从而规避了以往方法固有的潜在优化不稳定性。除提供理论保证外,我们给出了将算法应用于离策略策略评估的实证研究,发现相比现有技术,我们的算法显著提升了准确性。

关键词

引用

@article{arxiv.1906.04733,
  title  = {DualDICE: Behavior-Agnostic Estimation of Discounted Stationary Distribution Corrections},
  author = {Ofir Nachum and Yinlam Chow and Bo Dai and Lihong Li},
  journal= {arXiv preprint arXiv:1906.04733},
  year   = {2019}
}

备注

Appearing in NeurIPS 2019 Vancouver, Canada