中文

一种用于多模态数据主题建模的深度自回归方法

计算机视觉与模式识别 2016-01-01 v3 信息检索 机器学习 神经与进化计算

摘要

基于潜在狄利克雷分配 (LDA) 的主题建模一直是处理多模态数据(例如图像标注任务)的首选框架。另一种建模多模态数据的流行方法是通过深度神经网络,例如深度玻尔兹曼机 (DBM)。最近,提出了一种名为文档神经自回归分布估计器 (DocNADE) 的新型主题模型,并在文本文档建模中展示了最先进的性能。在本工作中,我们展示了如何成功地将该模型应用并扩展至多模态数据,例如同时的图像分类与标注。首先,我们提出了 SupDocNADE,即 DocNADE 的有监督扩展,它增强了所学隐藏主题特征的判别能力,并展示了如何利用它从图像视觉词、标注词和类别标签信息中学习联合表示。我们在 LabelMe 和 UIUC-Sports 数据集上测试了我们的模型,结果表明其优于其他主题模型。其次,我们提出了该模型的深度扩展,并提供了一种训练深度模型的高效方法。实验结果表明,我们的深度模型优于其浅层版本,并在多媒体信息检索 (MIR) Flickr 数据集上达到了最先进的性能。

关键词

引用

@article{arxiv.1409.3970,
  title  = {A Deep and Autoregressive Approach for Topic Modeling of Multimodal Data},
  author = {Yin Zheng and Yu-Jin Zhang and Hugo Larochelle},
  journal= {arXiv preprint arXiv:1409.3970},
  year   = {2016}
}

备注

24 pages, 10 figures. A version has been accepted by TPAMI on Aug 4th, 2015. Add footnote about how to train the model in practice in Section 5.1. arXiv admin note: substantial text overlap with arXiv:1305.5306