探索/利用策略的元学习:多臂老虎机案例
人工智能
2012-07-24 v1 机器学习
机器学习
摘要
探索/利用 (E/E) 困境自然出现在科学的许多子领域中。多臂老虎机问题以其规范形式形式化了这一困境。该领域的大多数当前研究侧重于可应用于广泛问题的通用解决方案。然而,在实践中,通常可以获得关于特定类别目标问题的某种形式的先验信息。由于缺乏将其纳入 E/E 策略的系统方法,先验知识在当前解决方案中很少被使用。为解决特定类别的 E/E 问题,我们建议分三步进行:(i) 以目标 E/E 问题类别上的概率分布形式对先验知识建模;(ii) 选择一个大的候选 E/E 策略假设空间;以及 (iii) 求解一个优化问题,以找到在从先验分布抽取的问题样本上具有最大平均性能的候选 E/E 策略。我们用两个不同的假设空间说明了这种元学习方法:一个是 E/E 策略被数值参数化的空间,另一个是 E/E 策略被表示为小型符号公式的空间。我们为这两种情况提出了适当的优化算法。我们在双臂伯努利老虎机问题和各种游戏预算下的实验表明,元学习到的 E/E 策略优于文献中的通用策略(UCB1、UCB1-Tuned、UCB-v、KL-UCB 和 epsilon 贪婪);通过对奖励遵循截断高斯分布的臂进行测试,我们还评估了学习到的 E/E 策略的鲁棒性。
引用
@article{arxiv.1207.5208,
title = {Meta-Learning of Exploration/Exploitation Strategies: The Multi-Armed Bandit Case},
author = {Francis Maes and Damien Ernst and Louis Wehenkel},
journal= {arXiv preprint arXiv:1207.5208},
year = {2012}
}
备注
16 pages, Springer Selection of papers of ICAART'12