中文

判定串联重复下的单词混淆性

组合数学 2017-11-20 v2

摘要

DNA 中的串联重复是将一段 DNA 的拷贝插入到原始位置相邻位置的过程。受将数据存储于生物体中的应用启发,Jain 等人 (2016) 提出了研究校正串联重复的编码以提高数据存储的可靠性。我们研究了与这些编码研究相关的算法。如果存在两个长度至多为 kk 的串联重复序列使得生成的单词相等,则称两个单词是 k{\le}k-可混淆的。我们证明了判定两个单词是否 k{\le}k-可混淆的问题可以通过一种能有效检查 k=3k=3 的刻画在线性时间内求解。结合先前的结果,该判定问题对于 k3k\le 3 是线性时间可解的。我们猜想对于 k>3k>3 该问题是不可判定的。利用从该算法获得的见解,我们研究了串联重复编码的大小。我们改进了已知的上界,并构造了比先前构造具有更大尺寸的编码。我们确定了长度直至 20 的最优串联重复编码的大小,开发了为所有单词长度构造串联重复编码的递归方法,并计算了长度从 21 到 30 的最优串联重复编码大小的显式下界。

关键词

引用

@article{arxiv.1707.03956,
  title  = {Deciding the Confusability of Words under Tandem Repeats},
  author = {Yeow Meng Chee and Johan Chrisnata and Han Mao Kiah and Tuan Thanh Nguyen},
  journal= {arXiv preprint arXiv:1707.03956},
  year   = {2017}
}