中文

穷举精确字符串匹配:全人类基因组分析

数据结构与算法 2019-07-29 v1 信息检索

摘要

由于诸多实际应用,精确字符串匹配数十年来一直是计算机科学中的基本问题。其中一些涉及常见操作,如文件和文本编辑器中的搜索,或更近期的高级问题,如人工智能与生物信息学中的模式检测。已开发出数十种用于模式匹配的算法与方法,并且存在若干可执行生物序列中精确字符串匹配的编程语言、软件包、应用与在线系统。然而,这些技术局限于在序列中搜索特定且预定义的字符串。本文提出一种新方法(称为 Ex2SM),它是高级数据结构与算法的执行流水线,专为文本挖掘设计,可检测多变量生物序列中每一个可能的重复字符串。与文献中已知算法不同,本文方法对字符串无关,即不需要输入待搜字符串,而是能检测每一个出现至少两次的字符串,无论其长度、频率、字母表、重叠等属性如何。所解决问题的复杂度及所提方法的潜力通过在整个人类基因组上的实验分析得以展示。更具体地,所有长度不超过 50 字符的重复字符串均被检测出,由于此类长字符串可能排列组合呈指数增长,这一成就是其他算法实际上无法实现的。

关键词

引用

@article{arxiv.1907.11232,
  title  = {Exhaustive Exact String Matching: The Analysis of the Full Human Genome},
  author = {Konstantinos F. Xylogiannopoulos},
  journal= {arXiv preprint arXiv:1907.11232},
  year   = {2019}
}

备注

Paper accepted for publication at IEEE/ACM ASONAM 2019 conference, Vancouver, BC, Canada