离动态强化学习:基于域分类器的迁移训练
机器学习
2021-04-16 v2 人工智能
机器人学
机器学习
摘要
我们提出了一种简单、实用且直观的强化学习域适应方法。我们的方法源于这样一种思想:智能体在源域中的经验应与其在目标域中的经验看起来相似。基于强化学习的概率视角,我们形式化地表明,可以通过修正奖励函数来补偿动态差异从而实现这一目标。该修正后的奖励函数通过学习区分源域转移与目标域转移的辅助分类器即可简单估计。直观上,修正奖励函数惩罚智能体在源域中访问在目标域中不可能出现的状态和采取的动作。换言之,智能体因会表明其正在与源域而非目标域交互的转移而受罚。我们的方法适用于具有连续状态和动作的域,且不需要学习动态的显式模型。在离散与连续控制任务上,我们阐明了方法的机制并展示了其向高维任务的可扩展性。
引用
@article{arxiv.2006.13916,
title = {Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers},
author = {Benjamin Eysenbach and Swapnil Asawa and Shreyas Chaudhari and Sergey Levine and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:2006.13916},
year = {2021}
}
备注
Published at ICLR 2021. Code (https://github.com/google-research/google-research/tree/master/darc) and blog post (https://blog.ml.cmu.edu/2020/07/31/maintaining-the-illusion-of-reality-transfer-in-rl-by-keeping-agents-in-the-darc)