合成控制_bandits
机器学习
2022-02-16 v1 机器学习
摘要
本文提出了一种在实验单元较粗(由于干扰或其他原因)的环境中实验设计的新动态方法。在线平台上的“区域分割”实验是此类环境的一个例子。实验的成本或后悔值在此是一个自然的关注点。我们的新设计被称为合成控制Thompson采样(SCTS),以无实际有意义推断能力损失的方式最小化实验相关的后悔值。我们提供了理论保证,刻画了我们方法的近最优后悔值,以及相应处理效应估计量实现的错误率。在合成和真实世界数据上的实验突出了我们的方法相对于此类实验环境中常见的固定和“切换回”设计的优点。
引用
@article{arxiv.2202.07079,
title = {Synthetically Controlled Bandits},
author = {Vivek Farias and Ciamac Moallemi and Tianyi Peng and Andrew Zheng},
journal= {arXiv preprint arXiv:2202.07079},
year = {2022}
}