中文

正则化OFU:一种高效的非线性上下文_bandit UCB估计器

机器学习 2021-06-30 v1 人工智能

摘要

平衡探索与利用(EE)是上下文_bandit中的基本问题。EE权衡的一个有力原则是面对不确定性时的乐观(OFU),其中智能体根据奖励的上置信界(UCB)采取行动。OFU已在线性/核上下文_bandit中取得(近)最优后悔界。然而,对于一般非线性复杂任务(例如以深度神经网络为奖励函数的上下文_bandit),如何推导高效且有效的EE权衡方法尚属未知。本文提出一种名为正则化OFU(ROFU)的新型OFU算法。在ROFU中,我们通过可微函数度量奖励的不确定性,并通过求解正则化优化问题计算上置信界。我们证明,对于多臂_bandit、核上下文_bandit和神经正切核_bandit,ROFU在特定不确定性度量下取得(近)最优后悔界,从理论上证明了其在EE权衡上的有效性。重要的是,ROFU可采用基于梯度优化器的高效实现,易于扩展到神经正切核之外的一般深度神经网络模型,这与以往OFU方法形成鲜明对比。实证评估表明,ROFU在各种设置下的上下文_bandit中表现极佳。

关键词

引用

@article{arxiv.2106.15128,
  title  = {Regularized OFU: an Efficient UCB Estimator forNon-linear Contextual Bandit},
  author = {Yichi Zhou and Shihong Song and Huishuai Zhang and Jun Zhu and Wei Chen and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2106.15128},
  year   = {2021}
}