中文

具有特征反馈的线性_bandit

机器学习 2019-03-13 v2 机器学习

摘要

本文探讨了一种新形式的线性 bandit 问题,其中算法接收到通常的随机奖励以及关于哪些特征与奖励相关的随机反馈,后者反馈是新颖之处。本文的重点是为具有特征反馈的线性 bandit 开发新理论和算法。我们表明,具有特征反馈的线性 bandit 可以在时间范围 TT 上实现随 kTk\sqrt{T} 缩放的遗憾值,而无需事先知道哪些特征相关也无需知道相关特征的数量 kk。相比之下,传统线性 bandit 的遗憾值为 dTd\sqrt{T},其中 dd 是(相关和无关)特征的总数,因此若 kdk\ll d 则改进可能非常显著。新算法的计算复杂度与 kk 而非 dd 成正比,使其比传统线性 bandit 更适合真实世界应用。我们用合成和真实人类标注数据展示了新算法的性能。

关键词

引用

@article{arxiv.1903.03705,
  title  = {Linear Bandits with Feature Feedback},
  author = {Urvashi Oswal and Aniruddha Bhargava and Robert Nowak},
  journal= {arXiv preprint arXiv:1903.03705},
  year   = {2019}
}