过完备主题模型何时可识别?具有结构化稀疏性的张量 Tucker 分解的唯一性
机器学习
2013-08-14 v1 信息检索
数值分析
统计理论
机器学习
统计理论
摘要
过完备潜在表示近年来在无监督特征学习中非常流行。在本文中,我们指定了给定特定阶数的可观测矩时,哪些过完备模型是可识别的。我们考虑过完备 regime 下的概率混合模型或主题模型,其中潜在主题的数量可能大大超过观测词汇表的大小。虽然一般的过完备主题模型不可识别,但我们在称为主题持久性(topic persistence)的约束下建立了通用可识别性。我们的可识别性充分条件涉及对主题 - 词矩阵或模型总体结构的一组新颖的“高阶”扩展条件。这组高阶扩展条件允许过完备模型,并要求存在从潜在主题到高阶观测词的完美匹配。我们确立了随机结构化主题模型在过完备 regime 下以高概率(w.h.p.)是可识别的。我们的可识别性结果允许对主题比例使用一般(非退化)分布进行建模,因此,我们的框架可以处理任意相关的主题。我们的可识别性结果意味着一类具有结构化稀疏性的张量分解的唯一性,该类分解包含在 Tucker 分解类中,但比 Candecomp/Parafac (CP) 分解更一般。
引用
@article{arxiv.1308.2853,
title = {When are Overcomplete Topic Models Identifiable? Uniqueness of Tensor Tucker Decompositions with Structured Sparsity},
author = {Animashree Anandkumar and Daniel Hsu and Majid Janzamin and Sham Kakade},
journal= {arXiv preprint arXiv:1308.2853},
year = {2013}
}