中文

线性_bandit中的正交投影学习

机器学习 2019-10-25 v3 机器学习

摘要

在线性随机bandit模型中,每个臂为欧氏空间中的向量,每步观测收益为该时刻所选臂的未知线性函数。本文研究线性随机bandit模型中最优臂的学习问题,其中每个臂的期望奖励为臂向某子空间投影的未知线性函数,称之为投影奖励。与观测收益即对应奖励的经典线性bandit问题不同,每步的投影奖励不可观测。此类模型可用于推荐应用,其中观测收益受到个体偏置的污染,而我们希望在所学模型中排除之。在臂数有限情形下,我们提出一种策略以实现O(\bbDlogn)O(|\bbD|\log n)后悔值,其中nn为时间步数,\bbD|\bbD|为臂数。在臂选自无限紧集情形下,该策略实现O(n2/3(logn)1/2)O(n^{2/3}(\log{n})^{1/2})后悔值。实验验证了策略的有效性。

关键词

引用

@article{arxiv.1906.10981,
  title  = {Learning Orthogonal Projections in Linear Bandits},
  author = {Qiyu Kang and Wee Peng Tay},
  journal= {arXiv preprint arXiv:1906.10981},
  year   = {2019}
}