通过 Undo Maps 形式化的迁移强化学习
机器学习
2022-11-29 v1 人工智能
摘要
跨领域迁移知识是机器学习中最基本的问题之一,但在强化学习语境中有效做到这一点在很大程度上仍是一个开放问题。现有方法对任务细节做强假设,常缺乏有原则的目标,且——关键地——修改个体策略,当领域因状态空间漂移(即其内禀于环境并因此影响与之交互的每个智能体)而存在差异时,这可能是次优的。为应对这些缺陷,我们提出 TvD:通过分布匹配迁移,一个跨交互式领域迁移知识的框架。我们从以数据为中心的视角切入,借助其状态空间之间(可能复杂的)变换刻画环境差异,从而将迁移问题表述为学习撤销该变换。为此,我们引入一种基于轨迹分布间最优传输距离的新型优化目标——即源领域中已学策略生成的轨迹与目标领域中可学习的推前策略生成的轨迹之间的分布。我们展示该目标导出了一种令人联想到模仿学习的策略更新方案,并推导出实现它的高效算法。我们在简单网格世界中的实验表明,该方法在广泛的环境变换下实现了成功的迁移学习。
引用
@article{arxiv.2211.14469,
title = {Transfer RL via the Undo Maps Formalism},
author = {Abhi Gupta and Ted Moskovitz and David Alvarez-Melis and Aldo Pacchiano},
journal= {arXiv preprint arXiv:2211.14469},
year = {2022}
}
备注
8 main pages, 3 appendix