中文

理解反馈在带切换成本的在线学习中的作用

机器学习 2023-06-19 v1

摘要

本文研究反馈在带切换成本的在线学习中的作用。已有研究表明,在 bandit 反馈下极小极大后悔为 Θ~(T2/3)\widetilde{\Theta}(T^{2/3}),而在全信息反馈下改善为 Θ~(T)\widetilde{\Theta}(\sqrt{T}),其中 TT 为时间范围长度。然而,反馈的数量与类型一般而言如何影响后悔仍很大程度上未知。为此,我们首先考虑带额外观测的 bandit 学习设定;即除典型 bandit 反馈外,学习者可自由地进行总计 BexB_{\mathrm{ex}} 次额外观测。我们完全刻画了该设定下的极小极大后悔,其展现出有趣的相变现象:当 Bex=O(T2/3)B_{\mathrm{ex}} = O(T^{2/3}) 时,后悔仍为 Θ~(T2/3)\widetilde{\Theta}(T^{2/3}),但当 Bex=Ω(T2/3)B_{\mathrm{ex}} = \Omega(T^{2/3}) 时,其变为 Θ~(T/Bex)\widetilde{\Theta}(T/\sqrt{B_{\mathrm{ex}}}),并随预算 BexB_{\mathrm{ex}} 增大而改善。为设计能达到极小极大后悔的算法,考虑学习者具有 BB 次总观测预算的更一般设定是有益的。我们也完全刻画了该设定下的极小极大后悔,并证明其其为 Θ~(T/B)\widetilde{\Theta}(T/\sqrt{B}),随总预算 BB 平滑标度。此外,我们提出一个通用算法框架,使我们能基于反馈的数量与类型为两种设定设计不同的学习算法以达到匹配的上界。一个有趣发现是,当预算相对有限时 bandit 反馈仍能保证最优后悔,但当预算相对较大时它不再足以实现最优后悔。

关键词

引用

@article{arxiv.2306.09588,
  title  = {Understanding the Role of Feedback in Online Learning with Switching Costs},
  author = {Duo Cheng and Xingyu Zhou and Bo Ji},
  journal= {arXiv preprint arXiv:2306.09588},
  year   = {2023}
}

备注

Accepted to ICML 2023