线性_bandit中的正交投影学习
机器学习
2019-10-25 v3 机器学习
摘要
在线性随机bandit模型中,每个臂为欧氏空间中的向量,每步观测收益为该时刻所选臂的未知线性函数。本文研究线性随机bandit模型中最优臂的学习问题,其中每个臂的期望奖励为臂向某子空间投影的未知线性函数,称之为投影奖励。与观测收益即对应奖励的经典线性bandit问题不同,每步的投影奖励不可观测。此类模型可用于推荐应用,其中观测收益受到个体偏置的污染,而我们希望在所学模型中排除之。在臂数有限情形下,我们提出一种策略以实现后悔值,其中为时间步数,为臂数。在臂选自无限紧集情形下,该策略实现后悔值。实验验证了策略的有效性。
引用
@article{arxiv.1906.10981,
title = {Learning Orthogonal Projections in Linear Bandits},
author = {Qiyu Kang and Wee Peng Tay},
journal= {arXiv preprint arXiv:1906.10981},
year = {2019}
}