中文

面向非顾问专家的准真实无后悔在线学习

机器学习 2025-02-18 v1 计算机科学与博弈论 机器学习

摘要

我们研究了一种在T轮中,N个战略专家每轮报告预测值给机制,机制选择一个预测值,然后揭示结果的在线预测设置。在任何一轮中,每个专家都有关于结果的信念,但专家希望选择其报告,以最大化其被选中的次数。机制的目标是获得低信念后悔:即其累积损失(基于所选预测)与基于专家信念的事后最佳专家累积损失之差。我们考虑非顾问专家的准真实机制,即在任何未来轮中,真实报告其信念严格最大化专家主观被选中的概率。即使在完全信息设置下,获取该设置下的第一个无后悔准真实机制仍是一个开放问题。我们通过对独立事件彩票预测竞赛机制(I-ELF)的在线扩展,开发了第一个针对该设置的无后悔机制。将该在线I-ELF视为基于损失相关扰动的随机漫步的FPL(Follow the Perturbed Leader)新型实例,我们获得了O~(TN)\tilde{O}(\sqrt{T N})后悔。我们的成果基于我们开发的针对泊松二项分布的新型尾部界限。我们将结果扩展到bandit设置,给出一个准真实机制获得O~(T2/3N1/3)\tilde{O}(T^{2/3} N^{1/3})后悔;这也是即使近似准真实机制中首个无后悔结果。

引用

@article{arxiv.2502.11483,
  title  = {No-regret incentive-compatible online learning under exact truthfulness with non-myopic experts},
  author = {Junpei Komiyama and Nishant A. Mehta and Ali Mortazavi},
  journal= {arXiv preprint arXiv:2502.11483},
  year   = {2025}
}

备注

44 pages