中文

离线神经上下文_bandits:悲观性、优化与泛化

机器学习 2022-03-15 v2 人工智能 机器学习

摘要

离线策略学习(OPL)利用先验收集的数据进行策略优化,而无需任何主动探索。尽管该问题普遍且近期受到关注,其在函数逼近设定下的理论与算法基础仍不成熟。本文从分布偏移、优化和泛化三个维度,研究具有神经网络的离线上下文_bandits 中的这一问题。具体而言,我们提出了一种可证明高效的、带神经网络函数逼近的离线上下文_bandit 方法,该方法不要求对奖励施加任何函数假设。我们表明,在比现有 OPL 工作更温和的分布偏移条件下,我们的方法可证明地对未见上下文具有泛化能力。值得注意的是,与其他 OPL 方法不同,我们的方法以在线方式使用随机梯度下降从离线数据中学习,使我们能将在线学习的优势引入离线设定。此外,我们表明我们的方法计算效率更高,并且对神经网络有效维度的依赖优于在线对应方法。最后,我们在一系列合成和真实世界 OPL 问题上展示了我们方法的经验有效性。

关键词

引用

@article{arxiv.2111.13807,
  title  = {Offline Neural Contextual Bandits: Pessimism, Optimization and Generalization},
  author = {Thanh Nguyen-Tang and Sunil Gupta and A. Tuan Nguyen and Svetha Venkatesh},
  journal= {arXiv preprint arXiv:2111.13807},
  year   = {2022}
}

备注

A full version at ICLR'22; a preliminary version at Offline RL Workshop at NeurIPS'21; code: https://github.com/thanhnguyentang/offline_neural_bandits