对比 UCB:在线强化学习中可证明高效的对比自监督学习
机器学习
2024-04-16 v3 机器学习
摘要
鉴于对比自监督学习在提取特征表示方面的强大能力,它已成功融入(深度)强化学习(RL)的实践,并在各类应用中实现了高效策略学习。尽管取得了巨大的实证成功,对用于强化学习的对比学习的理解仍不明晰。为缩小这一差距,我们在一类具有低秩转移的马尔可夫决策过程(MDP)和马尔可夫博弈(MG)中研究强化学习如何借助对比学习得到增强。针对这两种模型,我们提出通过最小化对比损失来提取低秩模型的正确特征表示。此外,在在线设置下,我们提出了新颖的上置信界(UCB)型算法,将此类对比损失与用于 MDP 或 MG 的在线 RL 算法相结合。我们进一步从理论上证明,我们的算法恢复了真实表示,同时在学习最优策略和 MDP 与 MG 中的纳什均衡方面实现了样本效率。我们还提供了实证研究以证明基于 UCB 的对比学习方法用于 RL 的有效性。据我们所知,我们提供了首个将对比学习用于表示学习的可证明高效的在线 RL 算法。我们的代码可在 https://github.com/Baichenjia/Contrastive-UCB 获取。
引用
@article{arxiv.2207.14800,
title = {Contrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning},
author = {Shuang Qiu and Lingxiao Wang and Chenjia Bai and Zhuoran Yang and Zhaoran Wang},
journal= {arXiv preprint arXiv:2207.14800},
year = {2024}
}
备注
ICML 2022