中文

面向离线强化学习的数据估值

机器学习 2022-05-20 v1

摘要

深度强化学习(DRL)的成功依赖于训练数据的可用性,这类数据通常通过大量的环境交互获得。在许多现实场景中,收集这些数据伴随着成本与风险。离线强化学习领域通过将这些数据收集工作外包给领域专家或经过严格监控的程序,随后寻找批量约束的最优策略,来解决上述问题。随着数据市场的出现,构建内部数据集的一种替代方案是购买外部数据。然而,尽管最先进的离线强化学习方法已展现出巨大潜力,它们目前仍依赖于与预期目标领域高度契合的精心构建的数据集。这引发了关于在外部获取的数据上训练的离线强化学习智能体的可迁移性与鲁棒性的疑问。在本文中,我们在两个 MuJoCo 环境中实证评估了当前最先进的离线强化学习方法应对源-目标领域不匹配的能力,发现当前最先进的离线强化学习算法在目标领域表现不佳。为此,我们提出了面向离线强化学习的数据估值(DVORL),该方法使我们能够识别相关且高质量的转移样本,从而提升离线强化学习算法所学策略的性能与可迁移性。结果表明,我们的方法在两个 MuJoCo 环境上优于离线强化学习基线方法。

关键词

引用

@article{arxiv.2205.09550,
  title  = {Data Valuation for Offline Reinforcement Learning},
  author = {Amir Abolfazli and Gregory Palmer and Daniel Kudenko},
  journal= {arXiv preprint arXiv:2205.09550},
  year   = {2022}
}

备注

9 pages, 3 figures, 2 tables