中文

基于超级词的概念建模

机器学习 2012-05-01 v1 计算与语言 信息检索 机器学习

摘要

在信息检索中,一个根本目标是将文档转化为能代表其内容的概念。术语“代表”本身难以定义,且不同任务需要不同粒度的概念。在本文中,我们旨在对词汇上稀疏的概念进行建模,使其能够根据其他相关语义信息(如文本结构或关联图像特征)灵活调整内容。我们探索了一种基于嵌套 Beta 过程的贝叶斯非参数模型,该模型允许推断未知数量的严格稀疏概念。由此产生的模型提供了与标准 LDA(或 HDP)主题模型本质上不同的概念表示,并允许直接整合语义特征。我们在多语言博客数据和国会记录上展示了这种表示的实用性。

关键词

引用

@article{arxiv.1204.2523,
  title  = {Concept Modeling with Superwords},
  author = {Khalid El-Arini and Emily B. Fox and Carlos Guestrin},
  journal= {arXiv preprint arXiv:1204.2523},
  year   = {2012}
}