近似字符串匹配:理论与应用(La Recherche Approchée de Motifs : Théorie et Applications)
摘要
近似字符串匹配是一个在大多数计算机科学领域中出现的根本且反复出现的问题。该问题可定义如下:令 为定义在字母表 上的 个单词的集合,令 为同样定义在 上的查询,并令 为正整数。我们希望在 上构建一种数据结构,能够回答以下查询:找出 中所有与查询词 至多相差 个错误的单词。在本论文中,我们研究字典、文本和索引中的近似字符串匹配方法,以提出高效解决该问题的实用方法。我们从三个互补方向探讨此问题:1) 字典中的近似字符串匹配。我们提出该问题的两种解决方案,第一种使用哈希表用于 ,第二种使用 Trie(字典树)和反向 Trie,且限于 (k = 1)。这两种方案在不损失性能的情况下可适用于文本中的近似字符串匹配。2) 用于自动补全(autocompletion)的近似字符串匹配,即找出给定前缀的所有可能包含错误的后缀。我们给出了一种在实践中优于所有先前提出方案的新方案。3) 生物序列比对问题可解释为近似字符串匹配问题。我们提出了一种用于双序列和多序列比对的解决方案。\medskip 所有获得的结果表明,我们的算法在实用数据集(来自真实世界的基准)上给出了最佳性能。我们所有的方法均作为库提供,并在线发布。
引用
@article{arxiv.1701.08688,
title = {Approximate String Matching: Theory and Applications (La Recherche Approch\'ee de Motifs : Th\'eorie et Applications)},
author = {Ibrahim Chegrane},
journal= {arXiv preprint arXiv:1701.08688},
year = {2017}
}
备注
181 pages, in French, PhD Thesis, University of Sciences and Technology Houari Boumediene (USTHB) Algiers Algeria, Text Algorithms, String searching, String matching, Pattern matching, Data structures, Exact string matching, Approximate string matching, Bioinformatics, Autocomplete