多参考余弦:大规模集合中文本相似性度量的新方法
信息检索
2018-10-09 v1
摘要
高效且可扩展的文档相似性检测系统的重要性在当今毋庸置疑。搜索引擎需要批量文本相似性度量以在其索引中检测重复与近似重复的网页,从而防止对同一网页多次索引。此外,在排序阶段,搜索引擎需要相似性度量以检测网页上的重复内容,从而提升其结果质量。本文通过结合降维技术与信息增益理论中的一些思想,提出了一种批量文本相似性检测的新方法。该新方法聚焦于搜索引擎检测重复与近似重复网页的需求。新方法在 NEWS20 数据集上评估,结果表明其在速度与性能上快于余弦文本相似性算法。此外,它比另一竞争方法 Simhash 相似性算法更快且更准确。
引用
@article{arxiv.1810.03099,
title = {Multi-reference Cosine: A New Approach to Text Similarity Measurement in Large Collections},
author = {Hamid Mohammadi and Amin Nikoukaran},
journal= {arXiv preprint arXiv:1810.03099},
year = {2018}
}
备注
8 pages, 18 figures, 1 table, 3 equations