中文

弹性退化字符串特征的困难性结果

数据结构与算法 2024-11-19 v1 计算复杂性

摘要

普通字符串的推广被提出作为一种紧凑方式,用于表示一组近乎相同的序列,或通过枚举所有可能性来表达特定文本位置的不确定性。普通字符串在每个位置存储一个字符,而推广形式则考虑字符集合(不定字符串)、等长字符串集合(广义退化字符串,简称 GD 字符串)或任意长度字符串集合(弹性退化字符串,简称 ED 字符串)。这些推广对于紧凑表示此类数据具有重要意义,并在生物信息学中找到应用,用于表示和维护同一分类群的一组基因序列或多重序列比对。为了使其发挥作用,研究者关注通过推广普通字符串的已知技术来回答各种查询类型,如模式匹配或测量 ED 字符串的相似性。然而,对于某些查询类型,已证明在经典字符串上可在多项式时间内求解的查询,其推广在 ED 字符串上变为 NP-hard,例如 [Russo et al.,2022]。在此背景下,我们探讨生物信息学中特别感兴趣的其他查询类型:最长重复因子、唯一子串、缺失词、反幂以及最长前因子的搜索。虽然我们为 ED 字符串上的第一个问题获得了一个多项式时间算法,但我们证明所有其他问题均为 NP-hard,其中一些甚至在输入可建模为不定字符串或 GD 字符串的限制下仍然是 NP-hard。

关键词

引用

@article{arxiv.2411.10653,
  title  = {Hardness Results on Characteristics for Elastic-Degenerated Strings},
  author = {Dominik Köppl and Jannik Olbrich},
  journal= {arXiv preprint arXiv:2411.10653},
  year   = {2024}
}