少量探索足矣
机器学习
2023-10-27 v1
摘要
“面对不确定性保持乐观”的流行原则主张引入探索奖励,通常假定其与访问次数的平方根倒数()成正比,其中 为对特定状态-动作对的访问次数。然而,该方法仅关注“不确定性”,忽视了不同选项固有的“难度”。为弥补此不足,我们在多臂老虎机问题中引入标准 UCB 算法的新型修正,提出考虑任务难度的调整奖励项 (其中 )。我们提出的算法记为 UCB,通过全面的后悔与风险分析得到证实,确认其理论稳健性。在合成数据集上与标准 UCB 及 Thompson Sampling 算法的比较评估表明,UCB 不仅在效能上更优,而且在各种环境条件和超参数设置下展现出更低的风险。
引用
@article{arxiv.2310.17538,
title = {Little Exploration is All You Need},
author = {Henry H. H. Chen and Jiaming Lu},
journal= {arXiv preprint arXiv:2310.17538},
year = {2023}
}