强化学习中的单回合策略迁移
机器学习
2020-02-14 v3 机器学习
摘要
迁移并适应未知的新环境动态是强化学习(RL)面临的一项关键挑战。一个更大的挑战是在测试时仅通过单次尝试就实现接近最优的性能,且可能无法获得密集奖励,而当前需要多次经验回滚才能适应的方法无法解决这一问题。为了在具有相关动态的环境族中实现单回合迁移,我们提出了一种通用算法,该算法优化一个探测模型和一个推理模型,以快速估计测试动态的潜在隐变量,然后立即将这些变量用作通用控制策略的输入。这种模块化方法能够集成变分推理或强化学习的最先进算法。此外,我们的方法在测试时无需访问奖励,使其能够在现有自适应方法无法工作的环境中执行任务。在具有单回合测试约束的多种实验领域中,我们的方法显著优于现有的自适应方法,并在鲁棒迁移方面展现出优于基线的性能。
引用
@article{arxiv.1910.07719,
title = {Single Episode Policy Transfer in Reinforcement Learning},
author = {Jiachen Yang and Brenden Petersen and Hongyuan Zha and Daniel Faissol},
journal= {arXiv preprint arXiv:1910.07719},
year = {2020}
}
备注
Published at International Conference on Learning Representations 2020