随机情境线性Bandit的实验设计
机器学习
2021-07-26 v2 机器学习
摘要
在随机线性情境bandit设定下,存在若干用于探索的极小极大过程,其策略对正在获取的数据具有反应性。在实践中,部署这些算法可能产生显著的工程开销,尤其是在以分布式方式收集数据集或需要人在回路中实施不同策略时。在这种情况下,使用单一非反应性策略进行探索是有益的。假设已有若干批量上下文可用,我们设计了一种单一的随机策略来收集良好的数据集,从中可提取出近似最优策略。我们给出了理论分析,以及在合成与真实世界数据集上的数值实验。
引用
@article{arxiv.2107.09912,
title = {Design of Experiments for Stochastic Contextual Linear Bandits},
author = {Andrea Zanette and Kefan Dong and Jonathan Lee and Emma Brunskill},
journal= {arXiv preprint arXiv:2107.09912},
year = {2021}
}
备注
Initial submission