具有结构化先验的多臂老虎机中的价值导向探索
机器学习
2017-05-18 v2 人工智能
机器学习
摘要
多臂老虎机是机器学习中需要平衡探索与利用的典型问题。虽然在开发具有强理论保证的算法方面已取得进展,但对实际近最优有限时间性能的关注较少。在本文中,我们提出了一种用于贝叶斯多臂老虎机的算法,该算法利用价值函数驱动的在线规划技术。基于先前关于 UCB 和 Gittins 指数的研究,我们引入了线性可分离的价值函数,该函数同时考虑预期回报和探索收益,以执行 n 步前瞻。该算法享有次线性性能保证,我们提供的模拟结果证实了其在具有结构化先验的问题中的优势。我们方法的简洁性和通用性使其成为分析更复杂多臂老虎机问题的有力候选者。
引用
@article{arxiv.1704.03926,
title = {Value Directed Exploration in Multi-Armed Bandits with Structured Priors},
author = {Bence Cserna and Marek Petrik and Reazul Hasan Russel and Wheeler Ruml},
journal= {arXiv preprint arXiv:1704.03926},
year = {2017}
}