迈向基于视频的强化学习表示学习原理
机器学习
2024-03-21 v1 人工智能
计算机视觉与模式识别
摘要
我们研究利用视频数据进行决策的预训练表示,这类数据在游戏智能体和软件测试等任务中大量存在。尽管在此问题上已取得显著的实证进展,但理论理解仍然缺失。我们启动了对表示学习原理性方法的理论探索,并专注于利用视频数据学习底层马尔可夫决策过程 (MDP) 的潜在状态表示。我们研究两种类型的设置:一种是观测中存在独立同分布 (iid) 噪声的设置,另一种是更具挑战性的设置,其中还存在外生噪声,即时间上相关的非 iid 噪声,例如背景中人或车的运动。我们研究了三种常用方法:自编码、时序对比学习和前向建模。我们证明了在仅存在 iid 噪声的情况下,时序对比学习和前向建模的上界。我们表明这些方法可以学习潜在状态,并利用它进行高效的下游强化学习 (RL),且具有多项式样本复杂度。当外生噪声也存在时,我们建立了一个下界结果,表明从视频数据学习的样本复杂度可能比从动作标记的轨迹数据学习差指数级。这在一定程度上解释了为什么基于视频预训练的强化学习是困难的。我们在两个视觉领域评估了这些表示学习方法,得到的结果与我们的理论发现一致。
引用
@article{arxiv.2403.13765,
title = {Towards Principled Representation Learning from Videos for Reinforcement Learning},
author = {Dipendra Misra and Akanksha Saran and Tengyang Xie and Alex Lamb and John Langford},
journal= {arXiv preprint arXiv:2403.13765},
year = {2024}
}
备注
ICLR 2024 Spotlight Conference Paper