HAMLET——一种支持学习曲线的多臂_bandit算法选择方法
机器学习
2020-05-29 v3 人工智能
机器学习
摘要
自动化算法选择与超参数调优促进了机器学习的应用。传统的多臂_bandit(multi-armed bandit)策略着眼于已观测奖励的历史,以识别最有希望的臂,从而长期优化期望总奖励。当考虑有限的时间预算与计算资源时,这种对奖励的向后视角是不合适的,因为 bandit 应向前看,以预期在指定时间预算结束时的最高最终奖励。本工作通过引入 HAMLET 来解决该洞见,其将 bandit 方法与学习曲线外推及计算时间感知相结合,以在一组机器学习算法中进行选择。结果表明,在基于记录的超参数调优轨迹的实验中,对于大多数考虑的时间预算,HAMLET 变体 1-3 表现出与其他基于 bandit 的算法选择策略相等或更好的性能。表现最佳的 HAMLET 变体 3 将学习曲线外推与著名的上置信界探索奖励相结合。该变体在 1,485 次运行中以 95% 水平的统计显著性优于所有非 HAMLET 策略。
引用
@article{arxiv.2001.11261,
title = {HAMLET -- A Learning Curve-Enabled Multi-Armed Bandit for Algorithm Selection},
author = {Mischa Schmidt and Julia Gastinger and Sébastien Nicolas and Anett Schülke},
journal= {arXiv preprint arXiv:2001.11261},
year = {2020}
}
备注
8 pages, 8 figures; IJCNN 2020: International Joint Conference on Neural Networks