中文

面向部分监测的兼得算法

机器学习 2022-10-11 v3 机器学习

摘要

本研究考虑具有 kk 个动作和 dd 个结果的部监测问题,并给出了首批兼得算法,其 regret 在随机与对抗两种情形下均有良好上界。具体而言,我们证明:对于非退化局部可观测博弈,在随机情形下 regret 为 O(m2k4log(T)log(kΠT)/Δmin)O(m^2 k^4 \log(T) \log(k_{\Pi} T) / \Delta_{\min}),在对抗情形下为 O(mk2/3Tlog(T)logkΠ)O(m k^{2/3} \sqrt{T \log(T) \log k_{\Pi}}),其中 TT 为轮数,mm 为每个动作的最大不同观测数,Δmin\Delta_{\min} 为最小次优间隙,kΠk_{\Pi} 为帕累托最优动作数。此外,我们证明:对于全局可观测博弈,在随机情形下 regret 为 O(cG2log(T)log(kΠT)/Δmin2)O(c_{\mathcal{G}}^2 \log(T) \log(k_{\Pi} T) / \Delta_{\min}^2),在对抗情形下为 O((cG2log(T)log(kΠT))1/3T2/3)O((c_{\mathcal{G}}^2 \log(T) \log(k_{\Pi} T))^{1/3} T^{2/3}),其中 cGc_{\mathcal{G}} 为依赖于博弈的常数。我们还给出了带对抗污染的随机情形下的 regret 上界。我们的算法基于跟随正则化领导者框架,并受反馈图在线学习领域中通过优化进行探索与自适应学习率方法的启发。

关键词

引用

@article{arxiv.2207.14550,
  title  = {Best-of-Both-Worlds Algorithms for Partial Monitoring},
  author = {Taira Tsuchiya and Shinji Ito and Junya Honda},
  journal= {arXiv preprint arXiv:2207.14550},
  year   = {2022}
}

备注

31 pages