预训练与强化学习:砍树前先磨利斧头
机器学习
2021-10-07 v1 人工智能
摘要
预训练是深度学习中用于提升性能和减少训练时间的常用技术,在深度强化学习(RL)中已展现出有前景的实验结果。然而,预训练需要相关的数据集进行训练。在本工作中,我们评估了在有干扰背景和無干扰背景下,使用相关性极低的大规模公开数据集以及通过自监督标注的逐案例生成数据集,对RL任务进行预训练的有效性。结果表明,在相关性较低的数据集上训练学到的滤波器会使预训练失效,而在同分布数据集上训练学到的滤波器能稳定减少RL训练时间并在80k步RL训练后提升性能。我们进一步研究,在环境步数有限的情况下,如何最优地将可用步数划分为预训练与RL训练以最大化RL性能。我们的代码已在GitHub上公开。
引用
@article{arxiv.2110.02497,
title = {Pretraining & Reinforcement Learning: Sharpening the Axe Before Cutting the Tree},
author = {Saurav Kadavath and Samuel Paradis and Brian Yao},
journal= {arXiv preprint arXiv:2110.02497},
year = {2021}
}