无任务工程的深度强化学习迁移探析
机器学习
2022-10-25 v1
摘要
我们评估了利用 Atari 2600 主机支持的原生游戏课程作为深度强化学习智能体的异质迁移基准。游戏设计者使用对诸如 Space Invaders、Breakout 与 Freeway 等游戏基础版本的若干离散修改组合来创建课程,使其对人类玩家渐进更具挑战性。通过将这些修改形式化为若干变异因子,我们能够表明方差分析(ANOVA)是研究人类相关域变化对深度强化学习智能体学习与迁移性能影响的强有力工具。由于我方无需手动任务工程,利用原生的多因子设计避免了无意中偏置实验设置的陷阱。我们发现游戏设计因子对智能体学习能力具有大而统计显著的影响,其组合交互亦如此。此外,我们展示了从基础游戏到各自变体的零样本迁移是可能的,但性能方差也主要由因子间交互解释。因此,我们认为 Atari 游戏课程为 RL 中的迁移学习提供了具挑战性的基准,可帮助社区沿对人类泛化性能有实质影响的维度更好地理解 RL 智能体的泛化能力。作为开端,我们报告了常规训练智能体的价值函数微调在多数情况下实现了正迁移,但算法创新仍有显著空间。我们以选择性地从多变体迁移可进一步提升性能的观测作结。
引用
@article{arxiv.2210.12448,
title = {Probing Transfer in Deep Reinforcement Learning without Task Engineering},
author = {Andrei A. Rusu and Sebastian Flennerhag and Dushyant Rao and Razvan Pascanu and Raia Hadsell},
journal= {arXiv preprint arXiv:2210.12448},
year = {2022}
}