来自噪声的免费午餐:表示学习中可证明且实用的探索
机器学习
2023-03-08 v2 人工智能
机器学习
摘要
表示学习处于深度学习应对维数灾难经验成功的核心。然而,由于 i) 表达力与可处理性之间的权衡,以及 ii) 探索与表示学习之间的耦合,表示学习的威力尚未在强化学习(RL)中得到充分利用。在本文中,我们首先揭示一个事实:在随机控制模型的某些噪声假设下,我们可以免费以闭式获得其对应马尔可夫转移算子的线性谱特征。基于这一观察,我们提出谱动力学嵌入(SPEDE),其通过利用噪声结构打破了权衡并完成了表示学习的乐观探索。我们对 SPEDE 提供了严格的理论分析,并在多个基准上展示了相对于现有最先进经验算法的实用优越性能。
引用
@article{arxiv.2111.11485,
title = {A Free Lunch from the Noise: Provable and Practical Exploration for Representation Learning},
author = {Tongzheng Ren and Tianjun Zhang and Csaba Szepesvári and Bo Dai},
journal= {arXiv preprint arXiv:2111.11485},
year = {2023}
}
备注
UAI 2022. The first two authors contribute equally