中文

一种基于长度过滤中增加符号重复以查找相似文档的方法

信息检索 2017-12-15 v1

摘要

海量数据集挖掘中的一个基本主题是查找相似项。例如,可推荐查找相似文档。对此已有许多方法,如 Shingling 方法与基于长度的过滤即是其中之一。在 Shingling 方法中,从每个文档选取带符号名的子串并置于一个集合中;为查找相似文档,计算与之相关集合间的相似度。基于长度的过滤仅比较长度相近的文档。这些方法未考虑符号的重复。考虑重复可更精确地计算文档长度。本文提出一种考虑符号重复的相似文档查找方法,该方法将文档分离为更佳形式。本文的主要目标是提出一种确实以更少比较次数与时间查找相似文档的方法。

关键词

引用

@article{arxiv.1712.03190,
  title  = {A Method for Finding Similar Documents Relying on Adding Repetition of Symbols in Length Based Filtering},
  author = {Hossein Azgomi and Masumeh Ghasemi Mahsayeh and Masoud Mohammadi and Milad Moradi},
  journal= {arXiv preprint arXiv:1712.03190},
  year   = {2017}
}