以自参照增强无监督强化学习
机器学习
2023-11-17 v1 人工智能
机器人学
摘要
人类具备在学习新任务并相应应用时明确调用过往经验的能力。我们认为这种自参照能力对于无监督预训练—再微调设定下的强化学习智能体尤为有利。在预训练期间,智能体的过往经验可被显式利用以缓解内在奖励的非平稳性。在微调阶段,参照历史轨迹可防止有价值探索行为被遗忘。受这些益处启发,我们提出自参照(Self-Reference, SR)方法,这是一种附加模块,专为在预训练—微调范式下利用历史信息并提升智能体性能而设计。我们的方法在无模型方法的无监督强化学习基准上,就四分位均值(Interquartile Mean, IQM)性能和最优性差距(Optimality Gap)缩减而言取得了最先进结果,录得 86% 的 IQM 与 16% 的最优性差距。此外,它将现有算法的 IQM 提升多达 17%,并将最优性差距缩减 31%。除性能提升外,自参照附加模块还提高了样本效率,这是实际应用中的一项关键属性。
引用
@article{arxiv.2311.09692,
title = {Augmenting Unsupervised Reinforcement Learning with Self-Reference},
author = {Andrew Zhao and Erle Zhu and Rui Lu and Matthieu Lin and Yong-Jin Liu and Gao Huang},
journal= {arXiv preprint arXiv:2311.09692},
year = {2023}
}
备注
Preprint