中文

使用深度玻尔兹曼机对 NeuroSynth 语料库进行文本挖掘

机器学习 2016-05-03 v1 计算与语言 神经元与认知 机器学习

摘要

大规模神经影像数据自动化元分析近年来已成为推进人类大脑功能理解的重要工具。该研究由 NeuroSynth 率先开展,这是一个收集了大量神经影像研究论文中的脑激活坐标及相关文本的数据库。此类元分析的基本方面之一是文本挖掘。迄今为止,已提出词频统计和更复杂的方法如潜在狄利克雷分配(Latent Dirichlet Allocation)。本工作中,我们提出使用深度玻尔兹曼机(DBMs)对 NeuroSynth 文本语料库进行无监督研究。相较于上述方法,使用 DBM 具有若干优势,其中主要在于其能在高维向量空间中产生词与文档的嵌入表示。此类嵌入有助于促进传统机器学习技术在文本语料库上的应用。所提出的 DBM 模型被证明能学习具有清晰语义结构的嵌入。

关键词

引用

@article{arxiv.1605.00223,
  title  = {Text-mining the NeuroSynth corpus using Deep Boltzmann Machines},
  author = {Ricardo Pio Monti and Romy Lorenz and Robert Leech and Christoforos Anagnostopoulos and Giovanni Montana},
  journal= {arXiv preprint arXiv:1605.00223},
  year   = {2016}
}

备注

4 pages, 1 figure