中文

少量探索足矣

机器学习 2023-10-27 v1

摘要

“面对不确定性保持乐观”的流行原则主张引入探索奖励,通常假定其与访问次数的平方根倒数(1/n1/\sqrt{n})成正比,其中 nn 为对特定状态-动作对的访问次数。然而,该方法仅关注“不确定性”,忽视了不同选项固有的“难度”。为弥补此不足,我们在多臂老虎机问题中引入标准 UCB 算法的新型修正,提出考虑任务难度的调整奖励项 1/nτ1/n^\tau(其中 τ>1/2\tau > 1/2)。我们提出的算法记为 UCBτ^\tau,通过全面的后悔与风险分析得到证实,确认其理论稳健性。在合成数据集上与标准 UCB 及 Thompson Sampling 算法的比较评估表明,UCBτ^\tau 不仅在效能上更优,而且在各种环境条件和超参数设置下展现出更低的风险。

关键词

引用

@article{arxiv.2310.17538,
  title  = {Little Exploration is All You Need},
  author = {Henry H. H. Chen and Jiaming Lu},
  journal= {arXiv preprint arXiv:2310.17538},
  year   = {2023}
}