科学文献的主题提取与相关文献打包
信息检索
2015-05-04 v2 数字图书馆
机器学习
摘要
基于共同特征对科学文献进行自动分类是一个极具趣味性的问题,在数字图书馆与信息检索系统中具有诸多应用。组织良好的文献对于自动生成科技文献分类体系、文本摘要、高效信息检索等非常有用。基于文献的关联特征从大量输入文献中生成文献包,是一项繁琐且计算成本高昂的任务。在本报告中,我们提出了一种两步自动方法,用于从一组科学文献中实时提取主题并对相关文献进行打包。在主题提取方面,我们利用潜在狄利克雷分配(Latent Dirichlet Allocation, LDA)主题建模技术;在文献打包方面,我们利用分层凝聚聚类技术。我们进行了实验以验证我们的打包语义,并将其与现有使用中的模型进行了比较。我们利用 Amazon 提供的名为 Amazon Mechanical Turk 的在线众包市场来开展实验。我们详细解释了实验设置与经验结果,并表明我们的方法优于现有方法。
引用
@article{arxiv.1212.5423,
title = {Topic Extraction and Bundling of Related Scientific Articles},
author = {Shameem A Puthiya Parambath},
journal= {arXiv preprint arXiv:1212.5423},
year = {2015}
}
备注
NeSeFo 2012