词典中改进的快速相似性搜索
信息检索
2010-08-19 v2 数据结构与算法
摘要
我们设计了一种算法来解决近似词典匹配问题。给定一个单词列表 、预处理时固定的最大距离 以及一个查询词 ,我们希望检索出 中所有可以通过 次或更少编辑操作转换为 的单词。我们提出了通过生成索引来支持容错查询的数据结构。在此基础上,我们提出了一种方法的泛化,显著降低了内存消耗和预处理时间。同时,查询的运行时间几乎不受影响。对于包含数十万甚至更多单词的列表,我们能够在微秒级时间内完成合理距离下的匹配。
引用
@article{arxiv.1008.1191,
title = {Improved Fast Similarity Search in Dictionaries},
author = {Daniel Karch and Dennis Luxen and Peter Sanders},
journal= {arXiv preprint arXiv:1008.1191},
year = {2010}
}
备注
Full version of a short paper accepted for Spire 2010, 13 pages