中文

域对抗强化学习

机器学习 2021-02-16 v1 人工智能

摘要

我们考虑强化学习中的泛化问题,其中观测的视觉方面可能有所不同,例如当存在不同背景或对比度、亮度等变化时。我们假设智能体在训练期间只能访问来自 MDP 分布的少数几个 MDP。然后在来自该分布的新的未知测试域(例如未见过的背景)上报告智能体的性能。针对这一“零样本 RL”任务,我们通过域对抗优化过程强制所学表征对视觉域保持不变。我们从经验上表明,该方法能够显著改善对新的未见域的泛化能力。

关键词

引用

@article{arxiv.2102.07097,
  title  = {Domain Adversarial Reinforcement Learning},
  author = {Bonnie Li and Vincent François-Lavet and Thang Doan and Joelle Pineau},
  journal= {arXiv preprint arXiv:2102.07097},
  year   = {2021}
}