用于转导线性_bandit的序贯实验设计
机器学习
2019-06-21 v1 机器学习
摘要
本文引入转导线性_bandit问题:给定测量向量集 、物品集 、固定置信度 以及未知向量 ,目标是通过顺序选择尽可能少的形如 的含噪测量,以 的概率推断 。当 时,该设定推广了线性_bandit;当 为标准基向量且 时,推广了组合_bandit。这种转导设定在测量向量集因可用性 or 成本等因素受限时自然出现。例如,在药物发现中,从业者出于成本或安全原因愿意在体外实验室评估的化合物和剂量 可能与可安全用于体内患者的化合物和剂量 大不相同。或者,在图书推荐系统中,被查询用户的图书集 可能限于知名畅销书,尽管目标可能是推荐更冷门的标题 。本文给出转导设定的实例相关下界、一个在这些下界对数因子内匹配的算法以及一项评估。特别地,我们给出首个近达信息论下界的线性_bandit非渐近算法。
引用
@article{arxiv.1906.08399,
title = {Sequential Experimental Design for Transductive Linear Bandits},
author = {Tanner Fiez and Lalit Jain and Kevin Jamieson and Lillian Ratliff},
journal= {arXiv preprint arXiv:1906.08399},
year = {2019}
}