DPP 最大似然学习的困难性
计算复杂性
2026-02-27 v4 数据结构与算法
机器学习
摘要
行列式点过程(DPPs)是一种广泛用于负相关数据的概率模型。DPPs 已成功应用于机器学习中以选择多样且具代表性的数据子集。在这些应用中,通常期望一组能最大化数据似然的参数。迄今用于此任务的算法要么在受限的 DPP 族上优化,要么使用不提供最优性理论保证的局部改进启发式方法。Kulesza(2011)在其关于机器学习中 DPPs 的开创性工作中猜想该问题是 NP-完全的。缺乏形式化证明促使 Brunel 等人(COLT 2017)提出,与 Kulesza 的猜想相反,可能存在一种多项式时间算法用于计算最大似然 DPP。他们还呈现了一些初步证据,支持一个他们建议可能导向此类算法的猜想。在本工作中我们证明了 Kulesza 的猜想。事实上,我们证明了如下更强的难近似结果:即使在含 个元素的基础集上计算 DPP 最大对数似然的 -近似也是 NP-完全的。从技术角度,我们将近似 DPP 最大对数似然的问题归约到求解超图上 \textsc{-Coloring} 问题的间隙实例。该超图基于 Bogdanov 等人(FOCS 2002)的有界度构造,我们使用 Alon 与 Capalbo(FOCS 2007)的强扩展子对其增强。我们证明若秩- DPP 达到近最优对数似然,其边际核必须编码超图的几乎完美“向量着色”。最后,我们展示在移除一小部分“噪声”边后,这些连续向量可被解码为适当的 -着色。
引用
@article{arxiv.2205.12377,
title = {Hardness of Maximum Likelihood Learning of DPPs},
author = {Elena Grigorescu and Brendan Juba and Karl Wimmer and Ning Xie},
journal= {arXiv preprint arXiv:2205.12377},
year = {2026}
}