通过缺失数据生成实现情境 Thompson 采样
机器学习
2025-11-13 v2 人工智能
机器学习
摘要
我们提出了一种针对 Thompson 采样 (TS) 情境型臂价值算法的框架,其中算法的不确定性量化能力和决策能力取决于学习的生成模型质量。我们不把环境中的不确定性视为来自不可观测的潜在参数,而是将其视为来自缺失的、但可能可观测的结果(包括未来和反事实结果)。如果所有这些结果都被观察,就可以仅依据完整数据集拟合一个“准则”策略来做出决策。借此观念,我们在每次决策时,都使用生成模型对缺失结果进行概率性插值,拟合使用插值后完整数据集的策略,并使用该策略选择下一个动作。我们正式证明,该算法是 TS 的一种生成式表述,并建立了最新的 regret 界。值得注意的是,我们的 regret 界只通过其离线预测损失质量来依赖生成模型,并适用于任何拟合“准则”策略的方法。
引用
@article{arxiv.2502.07064,
title = {Contextual Thompson Sampling via Generation of Missing Data},
author = {Kelly W. Zhang and Tiffany Tianhui Cai and Hongseok Namkoong and Daniel Russo},
journal= {arXiv preprint arXiv:2502.07064},
year = {2025}
}
备注
NeurIPS 2025