中文

用于可扩展探索的反集中置信奖励

机器学习 2022-04-13 v2

摘要

在设计序贯决策算法时,内在奖励在处理探索-利用权衡中扮演核心角色,无论基础理论还是最先进的深度强化学习皆然。LinUCB 算法作为随机线性 bandit 文献的核心,规定了一种椭圆奖励,解决了在大型动作空间中利用共享信息的挑战。然而,由于维护动作特征逆协方差矩阵的计算成本,该奖励方案无法直接迁移到高维探索问题。我们引入\emph{反集中置信界}以高效近似椭圆奖励,使用一组训练用于从策略网络派生特征预测随机噪声的回归器。利用该近似,我们得到在 poly(d)\mathrm{poly}(d) 固定动作下获得 O~(dT)\tilde O(d \sqrt{T}) 后悔界的随机线性 bandit 算法。我们开发了在 Atari 基准上与当代内在奖励启发式方法竞争的深度强化学习实用变体。

关键词

引用

@article{arxiv.2110.11202,
  title  = {Anti-Concentrated Confidence Bonuses for Scalable Exploration},
  author = {Jordan T. Ash and Cyril Zhang and Surbhi Goel and Akshay Krishnamurthy and Sham Kakade},
  journal= {arXiv preprint arXiv:2110.11202},
  year   = {2022}
}