使用合成数据进行预训练有助于离线强化学习
人工智能
2024-05-28 v4 机器学习
摘要
最近有研究表明,对于离线深度强化学习(DRL),使用大型语言语料库预训练 Decision Transformer 可以提升下游性能(Reid et al., 2022)。一个自然的问题是,这种性能提升是否只能通过对语言进行预训练来实现,还是可以通过不涉及语言的更简单的预训练方案来实现。在本文中,我们首先表明语言对于性能提升并非必不可少,事实上,使用合成独立同分布(IID)数据进行少量更新的预训练可以匹配使用大型语言语料库预训练所带来的性能提升;此外,使用由一步马尔可夫链生成的数据进行预训练可以进一步提升性能。受这些实验结果的启发,我们随后考虑对一种流行的离线 DRL 算法 Conservative Q-Learning(CQL)进行预训练,该算法基于 Q-learning 并通常采用多层感知机(MLP)骨干网络。令人惊讶的是,使用简单合成数据进行少量更新的预训练也能改进 CQL,在 D4RL Gym 运动数据集上提供一致的性能提升。本文的结果不仅说明了预训练对于离线 DRL 的重要性,还表明预训练数据可以是合成的,并且可以通过极其简单的机制生成。
引用
@article{arxiv.2310.00771,
title = {Pre-training with Synthetic Data Helps Offline Reinforcement Learning},
author = {Zecheng Wang and Che Wang and Zixuan Dong and Keith Ross},
journal= {arXiv preprint arXiv:2310.00771},
year = {2024}
}
备注
37 pages, 17 figures; Published at ICLR 2024; Code: https://github.com/Victor-wang-902/synthetic-pretrain-rl