多臂赌博机问题中有限支撑模型的一个渐近最优策略
统计理论
2011-11-21 v3 统计理论
摘要
我们针对多臂赌博机问题提出了最小经验散度(MED)策略。我们证明了所提策略在有限支撑模型情况下的渐近最优性。在我们的设定中,Burnetas 和 Katehakis 已经提出了一个渐近最优策略。我们的策略在选择臂时使用了一个与 Burnetas 和 Katehakis 所用数量对偶的准则。该准则可通过凸优化技术轻松计算,并在实际实现中具有优势。我们通过模拟证实,与当前其他流行的策略相比,MED 策略在有限时间内表现出良好的性能。
引用
@article{arxiv.0905.2776,
title = {An Asymptotically Optimal Policy for Finite Support Models in the Multiarmed Bandit Problem},
author = {Junya Honda and Akimichi Takemura},
journal= {arXiv preprint arXiv:0905.2776},
year = {2011}
}