中文

面向神经上下文_bandit 的奖励偏置极大似然估计

机器学习 2022-05-31 v2 机器学习

摘要

奖励偏置极大似然估计(RBMLE)是自适应控制文献中处理探索-利用权衡的经典原理。本文研究具有一般有界奖励函数的随机上下文_bandit 问题,并提出 NeuralRBMLE,其通过对对数似然添加偏置项以强制探索来适配 RBMLE 原理。NeuralRBMLE 利用了神经网络的表示能力,并直接在参数空间中编码探索行为,而无需构造估计奖励的置信区间。我们提出两种 NeuralRBMLE 算法变体:第一种变体通过梯度上升直接获得 RBMLE 估计量,第二种变体通过近似将 RBMLE 简化为简单的索引策略。我们证明两种算法均达到 O~(T)\widetilde{\mathcal{O}}(\sqrt{T}) 后悔界。通过大量实验,我们证明了 NeuralRBMLE 算法在具有非线性奖励函数的真实世界数据集上取得了与最先进方法相当或更好的经验后悔值。

关键词

引用

@article{arxiv.2203.04192,
  title  = {Reward-Biased Maximum Likelihood Estimation for Neural Contextual Bandits},
  author = {Yu-Heng Hung and Ping-Chun Hsieh},
  journal= {arXiv preprint arXiv:2203.04192},
  year   = {2022}
}