中文

主题模型中稀疏主题分布的似然估计及其在 Wasserstein 文档距离计算中的应用

统计理论 2022-06-28 v2 统计方法学 机器学习 统计理论

摘要

本文研究主题模型中高维、离散、可能稀疏的混合模型的估计。数据由 pp 个词在 nn 个独立文档中的观测多项计数组成。在主题模型中,p×np\times n 期望词频矩阵被假设分解为 p×Kp\times K 词-主题矩阵 AAK×nK\times n 主题-文档矩阵 TT。由于两矩阵的列均表示属于概率单纯形的条件概率,AA 的列被视为对所有文档共有的 pp 维混合分量,而 TT 的列被视为文档特定的 KK 维混合权重,且允许稀疏。主要兴趣在于当 AA 已知或未知时,给出混合权重 TT 估计量的尖锐有限样本 1\ell_1 范数收敛速率。对已知 AA,我们建议对 TT 进行 MLE 估计。我们对 MLE 的非标准分析不仅确立了其 1\ell_1 收敛速率,还揭示了一个显著性质:MLE 无需额外正则化即可精确稀疏并包含 TT 的真实零模式。我们进一步表明,在大类稀疏主题分布中,MLE 既是极小极大最优的,又对未知稀疏性自适应。当 AA 未知时,我们通过优化对应于 AA 的插入式通用估计量 A^\hat{A} 的似然函数来估计 TT。对于任何满足详尽邻近 AA 条件的估计量 A^\hat{A},所得 TT 的估计量被证明保留为 MLE 所确立的性质。环境维度 KKpp 允许随样本量增长。我们的应用在于估计文档生成分布之间的 1-Wasserstein 距离。我们提出、估计并分析了对两个概率文档表示之间的新 1-Wasserstein 距离。

关键词

引用

@article{arxiv.2107.05766,
  title  = {Likelihood estimation of sparse topic distributions in topic models and its applications to Wasserstein document distance calculations},
  author = {Xin Bing and Florentina Bunea and Seth Strimas-Mackey and Marten Wegkamp},
  journal= {arXiv preprint arXiv:2107.05766},
  year   = {2022}
}