从前缀/后缀组合重构字符串集合
信息论
2021-10-07 v1 math.IT
摘要
从子串信息重构字符串的问题因其在基因组数据测序以及基于 DNA 和聚合物的数据存储中的重要性而有许多应用。一个实际重要且具有挑战性的范式要求基于由质谱设备生成的前缀和后缀组合的并集来重构字符串混合物。我们描述了新的编码方法,允许对从码本中选出的字符串子集进行唯一的联合重构,并给出了底层码本渐近速率的上界和下界。我们的码构造结合了二进制 Bh 和 Dyck 字符串的性质,并可扩展以容纳池中缺失的子串。作为辅助结果,我们获得了任意偶数参数 h 的二进制 Bh 序列的首次已知界,并描述了质谱分析固有的各种误差模型。本文包含对作者先前发表于 [24] 工作的修正。特别地,前缀码的界现在已被修正。
引用
@article{arxiv.2110.02352,
title = {Reconstruction of Sets of Strings from Prefix/Suffix Compositions},
author = {Ryan Gabrys and Srilakshmi Pattabiraman and Olgica Milenkovic},
journal= {arXiv preprint arXiv:2110.02352},
year = {2021}
}