中文

关于学习良分离高斯混合模型

数据结构与算法 2017-11-01 v1 机器学习 统计理论 统计理论

摘要

我们考虑在混合成分良分离时高效学习大量球面高斯混合模型的问题。在该问题最基本的形式中,给定来自 kk 个标准球面高斯均匀混合的样本,目标是利用 poly(k,d,1/δ)poly(k,d, 1/\delta) 个样本将均值估计至精度 δ\delta。本工作中,我们研究如下问题:解决该任务所需的最小均值分离度是多少?Vempala 与 Wang [JCSS 2004] 已知最优算法需要约 min{k,d}1/4\min\{k,d\}^{1/4} 的分离度。另一方面,Moitra 与 Valiant [FOCS 2010] 表明,当分离度为 o(1)o(1) 时,需要指数级多样本。我们弥合了这两界之间的显著差距,给出如下结果。1. 我们表明,当分离度为 o(logk)o(\sqrt{\log k}) 时,需要超多项式多样本。事实上,即便 kk 个高斯均值在 d=O(logk)d=O(\log k) 维中随机选取,此结论亦成立。2. 我们表明,当分离度为 Ω(logk)\Omega(\sqrt{\log k}) 时,poly(k,d,1/δ)poly(k,d,1/\delta) 个样本已足够。注意分离度界与 δ\delta 无关。该结果基于一种新颖高效的“精度提升”算法,其以真实均值的粗略估计为输入,并在 poly(k,d,1/δ)poly(k,d, 1/\delta) 时间内输出任意精度 δ\delta 的均值估计,前提是均值间分离度为 Ω(min{logk,d})\Omega(\min\{\sqrt{\log k},\sqrt{d}\})(与 δ\delta 无关)。我们还给出了在 d=O(1)d=O(1) 维且仅需 Ω(d)\Omega(\sqrt{d}) 分离度的计算高效算法。这些结果共同从本质上刻画了以多项式样本学习 kk 个球面高斯混合模型所需的成分间最优分离度阶。

关键词

引用

@article{arxiv.1710.11592,
  title  = {On Learning Mixtures of Well-Separated Gaussians},
  author = {Oded Regev and Aravindan Vijayaraghavan},
  journal= {arXiv preprint arXiv:1710.11592},
  year   = {2017}
}

备注

Appeared in FOCS 2017. 55 pages, 1 figure