释放预训练语言模型在离线强化学习中的威力
机器学习
2024-12-18 v5
摘要
离线强化学习(RL)旨在利用预先收集的数据集寻找近最优策略。在真实场景中,数据收集可能代价高昂且具风险;因此当域内数据有限时,离线 RL 尤为困难。鉴于大语言模型(LLMs)近期的进展及其少样本学习能力,本文引入\textbf{La}nguage Models for \textbf{Mo}tion Control(\textbf{LaMo}),一个基于 Decision Transformers 的通用框架,以有效将预训练语言模型(LMs)用于离线 RL。我们的框架强调四个关键组件:(1)用序列预训练的 LMs 初始化 Decision Transformers,(2)采用 LoRA 微调方法而非全权重微调,以有效结合 LMs 的预训练知识与域内知识,(3)使用非线性 MLP 变换替代线性投影来生成嵌入,(4)在微调期间集成辅助语言预测损失以稳定 LMs 并保留其原有语言能力。实证结果表明,\textbf{LaMo} 在稀疏奖励任务中取得优异性能,并在稠密奖励任务中缩小了基于价值的离线 RL 方法与决策变换器之间的差距。特别地,我们的方法在有限数据样本场景下展现出优越性能。
引用
@article{arxiv.2310.20587,
title = {Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning},
author = {Ruizhe Shi and Yuyao Liu and Yanjie Ze and Simon S. Du and Huazhe Xu},
journal= {arXiv preprint arXiv:2310.20587},
year = {2024}
}
备注
Format adjustment