基于合成观测学习未来表征以实现强化学习的样本高效性
机器学习
2024-05-21 v1 人工智能
摘要
在视觉强化学习 (RL) 中,上游表征学习在很大程度上决定了下游策略学习的效果。采用辅助任务可有针对性地增强智能体的视觉表征,从而提高下游 RL 的样本效率和性能。先前的高级辅助任务都 focus 于如何通过不同的辅助目标从有限的经验(包括观察、动作和奖励)中提取尽可能多的信息,而本文从另一角度出发:首先考虑辅助训练数据。我们尝试通过丰富辅助训练数据来改进强化学习的辅助表征学习,提出了一种新的自监督 RL 方法,即学习未来表征的合成观测 (LFS)。具体而言,我们提出了一种无需训练的方法来合成可能包含未来信息的观察,以及一种数据选择方法来消除不合格的合成噪声。剩余的合成观测和真实观测随后作为辅助数据,用于实现基于聚类的时序关联任务,以进行表征学习。LFS 使智能体能够提前获取尚未出现的观察,从而在它们发生后快速理解并利用它们。此外,LFS 不依赖于奖励或动作,这意味着它比最新的高级辅助任务具有更广泛的适用范围(例如,从视频中学习)。广泛的实验表明,我们的 LFS 在具有挑战性的连续控制任务上展现了领先的 RL 样本效率,并实现了基于无动作视频演示的高级视觉预训练。
引用
@article{arxiv.2405.11740,
title = {Learning Future Representation with Synthetic Observations for Sample-efficient Reinforcement Learning},
author = {Xin Liu and Yaran Chen and Dongbin Zhao},
journal= {arXiv preprint arXiv:2405.11740},
year = {2024}
}