技能增强强化学习加速:来自异构示范数据的层次化方法
机器学习
2025-09-03 v2 人工智能
摘要
从示范学习(LfD)是强化学习(RL)中一个已建立的研究问题,旨在利用专家示范数据进行预训练,以加速RL代理的学习。然而,专家示范数据的有限 availability 常常阻碍其有效辅助下游RL学习。为此,我们提出一种新颖的两阶段方法,称为技能增强强化学习加速(SeRLA)。SeRLA引入一个技能级别的对抗性正-无标签(PU)学习模型,通过学习专家示范数据和通用低成本示范数据,提取有用的技能先验知识。随后,它采用技能基准的软演员-评论家算法,利用所获取的先验知识为技能策略网络的下游在线RL阶段进行高效训练。此外,我们提出一种简单的技能级别数据增强技术,以缓解数据稀疏性,进一步提高技能先验学习和技能策略训练的效果。跨越多个标准RL基准的实验表明,SeRLA在加速下游任务的强化学习方面实现了最先进的性能,尤其在早期训练阶段表现突出。
引用
@article{arxiv.2412.06207,
title = {Skill-Enhanced Reinforcement Learning Acceleration from Heterogeneous Demonstrations},
author = {Hanping Zhang and Yuhong Guo},
journal= {arXiv preprint arXiv:2412.06207},
year = {2025}
}
备注
ECAI 2025; 8 pages