面向非顾问专家的准真实无后悔在线学习
机器学习
2025-02-18 v1 计算机科学与博弈论
机器学习
摘要
我们研究了一种在T轮中,N个战略专家每轮报告预测值给机制,机制选择一个预测值,然后揭示结果的在线预测设置。在任何一轮中,每个专家都有关于结果的信念,但专家希望选择其报告,以最大化其被选中的次数。机制的目标是获得低信念后悔:即其累积损失(基于所选预测)与基于专家信念的事后最佳专家累积损失之差。我们考虑非顾问专家的准真实机制,即在任何未来轮中,真实报告其信念严格最大化专家主观被选中的概率。即使在完全信息设置下,获取该设置下的第一个无后悔准真实机制仍是一个开放问题。我们通过对独立事件彩票预测竞赛机制(I-ELF)的在线扩展,开发了第一个针对该设置的无后悔机制。将该在线I-ELF视为基于损失相关扰动的随机漫步的FPL(Follow the Perturbed Leader)新型实例,我们获得了后悔。我们的成果基于我们开发的针对泊松二项分布的新型尾部界限。我们将结果扩展到bandit设置,给出一个准真实机制获得后悔;这也是即使近似准真实机制中首个无后悔结果。
引用
@article{arxiv.2502.11483,
title = {No-regret incentive-compatible online learning under exact truthfulness with non-myopic experts},
author = {Junpei Komiyama and Nishant A. Mehta and Ali Mortazavi},
journal= {arXiv preprint arXiv:2502.11483},
year = {2025}
}
备注
44 pages