无遗憾 M${}^{\natural}$-凹函数最大化:随机老虎机算法与对抗全信息设置的困难性
机器学习
2025-08-27 v3 数据结构与算法
摘要
M-凹函数,又称总替代估值函数,在离散数学和经济学等许多领域中发挥着基础作用。在实践中,通常无法预先获得 M-凹函数的完美知识,我们只能基于某些反馈以交互方式对其进行优化。受此类情况启发,我们研究了在线 M-凹函数最大化问题,这是 Murota 和 Shioura(1999)所研究问题的交互式版本。对于随机老虎机设置,在 次访问 M-凹函数的无偏噪声值预言机下,我们提出了 -简单遗憾和 -遗憾算法。证明这些结果的关键在于贪心算法对 M-凹函数最大化中局部误差的鲁棒性,这也是我们的主要技术成果之一。尽管我们在随机设置中获得了这些积极结果,但我们工作的另一项主要成果是关于对抗设置中的不可能性。我们证明,即使在全信息反馈下,也不存在每轮以多项式时间运行的算法能够对任意常数 实现 遗憾。我们的证明基于从三个拟阵的拟阵相交问题的归约,这将是在线学习中建立困难性的一种新颖方法。
引用
@article{arxiv.2405.12439,
title = {No-Regret M${}^{\natural}$-Concave Function Maximization: Stochastic Bandit Algorithms and Hardness of Adversarial Full-Information Setting},
author = {Taihei Oki and Shinsaku Sakaue},
journal= {arXiv preprint arXiv:2405.12439},
year = {2025}
}