成本高效的在线决策:一种组合多臂老虎机方法
机器学习
2025-01-30 v3
摘要
在线决策在众多现实应用中起着关键作用。在许多场景中,决策是基于对到达的数据点执行一系列测试而做出的。然而,执行所有测试可能代价高昂且并非总是可行。在本文中,我们基于组合多臂老虎机对在线决策问题给出了一种新颖的建模,并将执行测试的(可能是随机的)成本考虑在内。基于该建模,我们提供了一种用于成本高效在线决策的新框架,其可利用后验采样或 BayesUCB 进行探索。我们对用于成本高效在线决策的 Thompson Sampling 进行了理论分析,并给出了多种实验结果,证明了我们的框架在现实问题上的适用性。
引用
@article{arxiv.2308.10699,
title = {Cost-Efficient Online Decision Making: A Combinatorial Multi-Armed Bandit Approach},
author = {Arman Rahbar and Niklas Åkerblom and Morteza Haghir Chehreghani},
journal= {arXiv preprint arXiv:2308.10699},
year = {2025}
}
备注
Accepted in Transactions on Machine Learning Research (01/2025)