基于智能层次聚类的自动化文档索引:一种新方法
信息检索
2015-04-02 v1
摘要
随着电子格式文本数据数量的不断增长,对其进行组织已成为一项极具挑战性的任务。本文探讨了一种文档组织框架,该框架利用智能层次聚类算法为文档集生成索引。该框架旨在即使在大规模语料库下也能具备可扩展性和准确性。所提出算法的优势在于所需输入极少,大部分层次结构属性均通过统计方法自动确定。在预处理阶段使用主题建模确保了对输入数据各种变化的鲁棒性。实验工作使用了 20-Newsgroups 数据集。我们将所提出方法的 F-度量(F-measure)与传统的 K-Means 和 K-Medoids 聚类算法进行了比较。测试结果表明了该方法的有效性、效率和效能。经过广泛的实验,我们得出结论:该框架显示出进一步研究和 specialized 商业应用的潜力。
引用
@article{arxiv.1504.00191,
title = {Automated Document Indexing via Intelligent Hierarchical Clustering: A Novel Approach},
author = {Rajendra Kumar Roul and Shubham Rohan Asthana and Sanjay Kumar Sahay},
journal= {arXiv preprint arXiv:1504.00191},
year = {2015}
}
备注
6 Pages, 3 Figures. IEEE Xplore, ICHPCA-2014