中文

VSEC-LDA:通过嵌入词汇选择提升主题建模

计算机视觉与模式识别 2020-01-17 v1

摘要

主题建模已在许多潜在数据结构对典型推断任务至关重要的题目中得到广泛应用。应用主题模型时,一个相对标准的预处理步骤是首先构建高频词词汇表。这种通用的预处理步骤往往独立于主题建模阶段,因此无法保证预生成的词汇表能够支持推断出适合给定任务的最优(甚至有意义)主题模型,尤其是对于涉及“视觉词”的计算机视觉应用。本文提出一种称为词汇选择嵌入对应 LDA(VSEC-LDA)的主题建模新方法,其在学习潜在模型的同时选择最相关的词。选词由一个基于熵的度量驱动,该度量衡量词对底层模型的相对贡献,并在模型学习过程中动态完成。我们给出 VSEC-LDA 的三种变体,并在来自不同应用的合成与真实数据库上通过实验评估所提方法。结果证明了内置词汇选择的有效性及其对提升主题建模性能的重要性。

关键词

引用

@article{arxiv.2001.05578,
  title  = {VSEC-LDA: Boosting Topic Modeling with Embedded Vocabulary Selection},
  author = {Yuzhen Ding and Baoxin Li},
  journal= {arXiv preprint arXiv:2001.05578},
  year   = {2020}
}