中文

学习大离散域上任意分布的混合

机器学习 2013-09-19 v3 数据结构与算法

摘要

我们给出了一种学习非结构化分布混合的算法。该问题出现在各种无监督学习场景中,例如从涵盖多个主题的文档语料库中学习主题模型。我们展示了如何学习kk个任意分布在大离散域[n]={1,2,,n}[n]=\{1,2,\dots,n\}上的混合以及混合权重,使用O(n\polylogn)O(n\polylog n)个样本。(在主题模型学习设定中,混合成分对应主题分布。)在通常的混合分布采样过程中,对于k>1k>1,该任务在信息论上是不可能的。然而,存在一些情况(如上述主题模型案例),其中每个样本点包含来自同一混合成分的多个观测值。这个观测数量,我们称之为“采样孔径”,是问题的关键参数。我们获得了第一个无需对混合成分施加任何假设的混合学习问题的界限。我们证明了高效学习在信息论最小可能的孔径2k12k-1处是可能的。因此,我们实现了对nn的近乎最优依赖和最优孔径。虽然我们的算法所需的样本量对kk呈指数依赖,但我们证明当考虑一般混合时,这种依赖是不可避免的。一系列工具为算法做出了贡献,例如随机矩阵的集中结果、降维、矩估计和敏感性分析。

关键词

引用

@article{arxiv.1212.1527,
  title  = {Learning Mixtures of Arbitrary Distributions over Large Discrete Domains},
  author = {Yuval Rabani and Leonard Schulman and Chaitanya Swamy},
  journal= {arXiv preprint arXiv:1212.1527},
  year   = {2013}
}

备注

Update of previous version with improved aperture and sample-size lower bounds