中文

基于原型跨域随机预训练的强化学习

机器学习 2025-03-25 v5 人工智能

摘要

本工作已投稿至 IEEE 以备可能发表。版权可能在未通知的情况下转让,此后本版本可能无法访问。无监督跨域强化学习(RL)预训练在具有挑战性的连续视觉控制中展现出巨大潜力,但也带来了重大挑战。本文提出 \textbf{C}ross-domain \textbf{R}andom \textbf{P}re-\textbf{T}raining with \textbf{pro}totypes(CRPTpro),一种新颖、高效且有效的自监督跨域 RL 预训练框架。CRPTpro 将数据采样与编码器预训练解耦,提出解耦随机收集以轻松快速地生成合格的跨域预训练数据集。此外,提出一种新颖的原型自监督算法来预训练一个在不同域间通用的有效视觉编码器。无需微调,该跨域编码器即可用于不同域中定义的具有挑战性的下游任务,无论已见或未见。与近期先进方法相比,CRPTpro 在下游策略学习上取得更优性能,且无需为数据收集而额外训练探索智能体,大幅减轻了预训练负担。我们在八个具有挑战性的连续视觉控制域(包括平衡控制、机器人运动与操控)上进行了广泛实验。CRPTpro 在 12 个跨域下游任务中的 11 个上显著优于次优的 Proto-RL(C),且仅需 54.5\% 的挂钟预训练时间,展现出最先进的预训练性能及大幅提升的预训练效率。

关键词

引用

@article{arxiv.2302.05614,
  title  = {Cross-domain Random Pre-training with Prototypes for Reinforcement Learning},
  author = {Xin Liu and Yaran Chen and Haoran Li and Boyu Li and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2302.05614},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication