中文

具有一般非线性奖励函数的对抗组合赌博机

机器学习 2021-01-06 v1 机器学习

摘要

本文研究具有已知非线性奖励函数的对抗组合赌博机,扩展了关于对抗线性组合赌博机的已有工作。{具有一般非线性奖励的对抗组合赌博机是赌博机文献中的一个重要开放问题,目前仍不清楚其与线性奖励、随机赌博机或半赌博机反馈情形是否存在显著差距。}我们证明,在 NN 个臂且每期从 TT 个时间段中选择 KK 个臂的子集时,若奖励函数为次数 d<Kd<Kdd 次多项式,则极小极大最优后悔为 Θ~d(NdT)\widetilde\Theta_{d}(\sqrt{N^d T});若奖励函数不是低次多项式,则为 ΘK(NKT)\Theta_K(\sqrt{N^K T})。{这两个界都与线性情形的界 O(poly(N,K)T)O(\sqrt{\mathrm{poly}(N,K)T}) 显著不同,表明线性与非线性奖励结构之间存在根本性差距。}我们的结果也可应用于在线推荐中的对抗品类优化问题。我们证明在对抗品类问题的最坏情况下,最优算法必须将每个独立的 (NK)\binom{N}{K} 个品类视作相互独立。

关键词

引用

@article{arxiv.2101.01301,
  title  = {Adversarial Combinatorial Bandits with General Non-linear Reward Functions},
  author = {Xi Chen and Yanjun Han and Yining Wang},
  journal= {arXiv preprint arXiv:2101.01301},
  year   = {2021}
}