中文

无遗憾 M${}^{\natural}$-凹函数最大化:随机老虎机算法与对抗全信息设置的困难性

机器学习 2025-08-27 v3 数据结构与算法

摘要

M{}^{\natural}-凹函数,又称总替代估值函数,在离散数学和经济学等许多领域中发挥着基础作用。在实践中,通常无法预先获得 M{}^{\natural}-凹函数的完美知识,我们只能基于某些反馈以交互方式对其进行优化。受此类情况启发,我们研究了在线 M{}^{\natural}-凹函数最大化问题,这是 Murota 和 Shioura(1999)所研究问题的交互式版本。对于随机老虎机设置,在 TT 次访问 M{}^{\natural}-凹函数的无偏噪声值预言机下,我们提出了 O(T1/2)O(T^{-1/2})-简单遗憾和 O(T2/3)O(T^{2/3})-遗憾算法。证明这些结果的关键在于贪心算法对 M{}^{\natural}-凹函数最大化中局部误差的鲁棒性,这也是我们的主要技术成果之一。尽管我们在随机设置中获得了这些积极结果,但我们工作的另一项主要成果是关于对抗设置中的不可能性。我们证明,即使在全信息反馈下,也不存在每轮以多项式时间运行的算法能够对任意常数 c>0c > 0 实现 O(T1c)O(T^{1-c}) 遗憾。我们的证明基于从三个拟阵的拟阵相交问题的归约,这将是在线学习中建立困难性的一种新颖方法。

关键词

引用

@article{arxiv.2405.12439,
  title  = {No-Regret M${}^{\natural}$-Concave Function Maximization: Stochastic Bandit Algorithms and Hardness of Adversarial Full-Information Setting},
  author = {Taihei Oki and Shinsaku Sakaue},
  journal= {arXiv preprint arXiv:2405.12439},
  year   = {2025}
}