科学文章的主题提取与相关文献 bundling
系统与控制
2012-12-24 v1
摘要
基于共同特征对科学文章进行自动分类是一个有趣的问题,在数字图书馆和信息检索系统中有着广泛的应用。组织良好的文章可用于科学著作中分类法的自动生成、文本摘要、高效信息检索等。基于文章的相关特征从大量输入文章中生成文章束是一项繁琐且计算成本高昂的任务。在本报告中,我们提出了一种自动两步法,用于实时从一组科学文章中提取主题并对相关文章进行 bundling。对于主题提取,我们利用潜在狄利克雷分配 (LDA) 主题建模技术;对于 bundling,我们利用层次凝聚聚类技术。我们运行实验以验证我们的 bundling 语义,并将其与现有使用的模型进行比较。我们利用亚马逊提供的在线众包市场 Amazon Mechanical Turk 进行实验。我们详细解释了我们的实验设置和经验结果,并表明我们的方法优于现有方法。
引用
@article{arxiv.1212.5421,
title = {Design of a Smart Embedded Uninterrupted Power Supply System for Personal Computers},
author = {A. M. Zungeru and A. J. Garba and J. G. Kolo and M. S. Ahmed and I. Olumide},
journal= {arXiv preprint arXiv:1212.5421},
year = {2012}
}
备注
20 pages, 15 figures, 4 tables, journal paper