中文

TSEC:实验约束下的在线实验框架

统计方法学 2021-01-19 v1 机器学习

摘要

Thompson采样是一种求解多臂老虎机问题的流行算法,已广泛应用于从网站设计到投资组合优化的众多领域。然而,在此类应用中,选择数(或臂数)NN 可能很大,而用于做出自适应决策的数据需要昂贵的实验。于是,每一时间段内只能在 KNK \ll N 个小子集臂上进行实验,这给传统Thompson采样带来了问题。我们提出了一种实验约束下的新Thompson采样(TSEC)方法,以应对所谓的“臂预算约束”。TSEC利用带有效应层级先验的贝叶斯交互模型,对不同臂上奖励之间的相关性进行建模。该拟合模型随后被集成到Thompson采样中,以联合识别用于实验的优质臂子集并在这些臂上分配资源。我们在两个具有臂预算约束的问题中展示了TSEC的有效性。第一个是模拟的网站优化研究,其中TSEC相较行业基准有显著提升。第二个是基于行业交易所交易基金的投资组合优化应用,其中TSEC相较于标准投资策略实现了更一致且更高的财富积累。

关键词

引用

@article{arxiv.2101.06592,
  title  = {TSEC: a framework for online experimentation under experimental constraints},
  author = {Simon Mak and Yuanshuo Zhou and Lavonne Hoang and C. F. Jeff Wu},
  journal= {arXiv preprint arXiv:2101.06592},
  year   = {2021}
}