关于多臂老虎机知识梯度策略缺陷的识别与缓解
机器学习
2017-04-07 v2 机器学习
摘要
知识梯度(KG)策略最初是为在线排序与选择问题提出的,但最近已被改编用于一般的在线决策,特别是多臂老虎机问题(MABs)。我们研究了其在指数族MABs中的使用,并发现了其缺陷,包括倾向于采取在利用和探索方面均处于劣势的动作。我们提出了避免此类错误的KG变体。这些新策略包括一种指数启发式方法,该方法部署KG方法以开发Gittins指数的近似。一项数值研究表明,该策略在包括指数策略非最优的MABs在内的多种MABs上表现良好。虽然当老虎机为高斯分布时KG不会做出劣势动作,但它未能保持指数一致性,并且当臂相关时,似乎并未表现出优于竞争策略的性能优势,以弥补其更大的计算需求。
引用
@article{arxiv.1607.05970,
title = {On the Identification and Mitigation of Weaknesses in the Knowledge Gradient Policy for Multi-Armed Bandits},
author = {James Edwards and Paul Fearnhead and Kevin Glazebrook},
journal= {arXiv preprint arXiv:1607.05970},
year = {2017}
}
备注
Minor typos corrected