主题模型中稀疏主题分布的似然估计及其在 Wasserstein 文档距离计算中的应用
统计理论
2022-06-28 v2 统计方法学
机器学习
统计理论
摘要
本文研究主题模型中高维、离散、可能稀疏的混合模型的估计。数据由 个词在 个独立文档中的观测多项计数组成。在主题模型中, 期望词频矩阵被假设分解为 词-主题矩阵 与 主题-文档矩阵 。由于两矩阵的列均表示属于概率单纯形的条件概率, 的列被视为对所有文档共有的 维混合分量,而 的列被视为文档特定的 维混合权重,且允许稀疏。主要兴趣在于当 已知或未知时,给出混合权重 估计量的尖锐有限样本 范数收敛速率。对已知 ,我们建议对 进行 MLE 估计。我们对 MLE 的非标准分析不仅确立了其 收敛速率,还揭示了一个显著性质:MLE 无需额外正则化即可精确稀疏并包含 的真实零模式。我们进一步表明,在大类稀疏主题分布中,MLE 既是极小极大最优的,又对未知稀疏性自适应。当 未知时,我们通过优化对应于 的插入式通用估计量 的似然函数来估计 。对于任何满足详尽邻近 条件的估计量 ,所得 的估计量被证明保留为 MLE 所确立的性质。环境维度 与 允许随样本量增长。我们的应用在于估计文档生成分布之间的 1-Wasserstein 距离。我们提出、估计并分析了对两个概率文档表示之间的新 1-Wasserstein 距离。
引用
@article{arxiv.2107.05766,
title = {Likelihood estimation of sparse topic distributions in topic models and its applications to Wasserstein document distance calculations},
author = {Xin Bing and Florentina Bunea and Seth Strimas-Mackey and Marten Wegkamp},
journal= {arXiv preprint arXiv:2107.05766},
year = {2022}
}