中文

用于转导线性_bandit的序贯实验设计

机器学习 2019-06-21 v1 机器学习

摘要

本文引入转导线性_bandit问题:给定测量向量集 XRd\mathcal{X}\subset \mathbb{R}^d、物品集 ZRd\mathcal{Z}\subset \mathbb{R}^d、固定置信度 δ\delta 以及未知向量 θRd\theta^{\ast}\in \mathbb{R}^d,目标是通过顺序选择尽可能少的形如 xθx^\top\theta^{\ast} 的含噪测量,以 1δ1-\delta 的概率推断 argmaxzZzθ\text{argmax}_{z\in \mathcal{Z}} z^\top\theta^\ast。当 X=Z\mathcal{X}=\mathcal{Z} 时,该设定推广了线性_bandit;当 X\mathcal{X} 为标准基向量且 Z{0,1}d\mathcal{Z}\subset \{0,1\}^d 时,推广了组合_bandit。这种转导设定在测量向量集因可用性 or 成本等因素受限时自然出现。例如,在药物发现中,从业者出于成本或安全原因愿意在体外实验室评估的化合物和剂量 X\mathcal{X} 可能与可安全用于体内患者的化合物和剂量 Z\mathcal{Z} 大不相同。或者,在图书推荐系统中,被查询用户的图书集 X\mathcal{X} 可能限于知名畅销书,尽管目标可能是推荐更冷门的标题 Z\mathcal{Z}。本文给出转导设定的实例相关下界、一个在这些下界对数因子内匹配的算法以及一项评估。特别地,我们给出首个近达信息论下界的线性_bandit非渐近算法。

关键词

引用

@article{arxiv.1906.08399,
  title  = {Sequential Experimental Design for Transductive Linear Bandits},
  author = {Tanner Fiez and Lalit Jain and Kevin Jamieson and Lillian Ratliff},
  journal= {arXiv preprint arXiv:1906.08399},
  year   = {2019}
}