域对抗强化学习
机器学习
2021-02-16 v1 人工智能
摘要
我们考虑强化学习中的泛化问题,其中观测的视觉方面可能有所不同,例如当存在不同背景或对比度、亮度等变化时。我们假设智能体在训练期间只能访问来自 MDP 分布的少数几个 MDP。然后在来自该分布的新的未知测试域(例如未见过的背景)上报告智能体的性能。针对这一“零样本 RL”任务,我们通过域对抗优化过程强制所学表征对视觉域保持不变。我们从经验上表明,该方法能够显著改善对新的未见域的泛化能力。
引用
@article{arxiv.2102.07097,
title = {Domain Adversarial Reinforcement Learning},
author = {Bonnie Li and Vincent François-Lavet and Thang Doan and Joelle Pineau},
journal= {arXiv preprint arXiv:2102.07097},
year = {2021}
}