多环境预训练实现向动作受限数据集的迁移
机器学习
2022-12-07 v2
摘要
利用大规模数据集训练大规模模型已成为自然语言与视觉应用中实现广泛泛化的主流方法。然而在强化学习中,一个关键挑战是:可用的序列决策数据往往未标注动作——例如,游戏游玩视频远比带有日志记录控制的帧序列更易获取。我们提出通过结合来自感兴趣的目标环境的大规模但稀疏标注数据集,与来自多种其他源环境的完全标注数据集,来规避这一挑战。我们的方法,即动作受限预训练(Action Limited PreTraining, ALPT),利用逆动力学建模(inverse dynamics modelling, IDM)的泛化能力来标注目标环境中缺失的动作数据。我们表明,在 IDM 预训练期间即便仅使用一个额外的带标注源环境数据集,也能在为目标环境未标注序列生成动作标签方面带来显著提升。我们在基准游戏环境中评估了该方法,并表明相较于其他方法,仅使用相当于 12 分钟游戏时长的标注数据集,即可显著改善游戏性能与泛化能力。为凸显 IDM 的威力,我们展示了即便目标与源环境不共享任何共同动作,这些收益依然成立。
引用
@article{arxiv.2211.13337,
title = {Multi-Environment Pretraining Enables Transfer to Action Limited Datasets},
author = {David Venuto and Sherry Yang and Pieter Abbeel and Doina Precup and Igor Mordatch and Ofir Nachum},
journal= {arXiv preprint arXiv:2211.13337},
year = {2022}
}