为数据高效离线强化学习预训练共享 Q 网络
人工智能
2025-10-22 v2 机器学习
摘要
离线强化学习(RL)旨在从静态数据集中学习策略,而无需进一步与环境交互。收集足够大的离线 RL 数据集耗费巨大资源,因为数据收集需要与环境进行大量交互,在环境交互受限的情况下尤为困难。因此,如何以最小的静态数据集学习出最佳策略,是离线 RL 中的关键问题,类似于在线 RL 中的样本效率问题。本文提出一种简单且有效的即插即用预训练方法,用于初始化 Q 网络的特征,以提升离线 RL 的数据效率。具体而言,我们引入一种共享 Q 网络结构,该网络输出下一状态的预测以及 Q 值。我们通过监督回归任务预训练共享 Q 网络,该任务预测下一个状态,并通过多样化的离线 RL 方法训练共享 Q 网络。经过大量实验,我们经验性地证明了该方法在 D4RL、Robomimic 和 V-D4RL 数据集基准测试中提升了现有流行离线 RL 方法的性能。此外,我们展示了该方法在 D4RL 和 ExoRL 数据集基准测试中显著提升了各种数据质量和数据分布下的高效离线 RL。值得注意的是,仅使用10%数据集的预训练方法可显著超越标准算法(即使使用完整数据集)。
引用
@article{arxiv.2505.05701,
title = {Pretraining a Shared Q-Network for Data-Efficient Offline Reinforcement Learning},
author = {Jongchan Park and Mingyu Park and Donghwan Lee},
journal= {arXiv preprint arXiv:2505.05701},
year = {2025}
}