中文

面向DNA链的数据驱动蜂群识别

信息论 2023-05-09 v1 math.IT

摘要

我们研究了一种面向DNA链蜂群识别问题的数据驱动方法。蜂群识别问题由Tandon等人(2019)提出,要求通过一组 MM 个含噪测量来识别 MM 只蜂,每只蜂由唯一条形码标记。后来,Chrisnata等人(2022)将该模型扩展至对每只蜂观测 NN 个含噪测量的情况,并将该模型应用于解决DNA存储系统的无序特性。在此类系统中,通常将唯一地址前置到每个DNA数据块以形成DNA链,但该地址可能受损。虽然聚类通常用于识别DNA链的地址,但这需要 M2\mathcal{M}^2 次数据比较(当 M\mathcal{M} 为读取数时)。相比之下,Chrisnata等人(2022)的方法完全避免了数据比较。本工作中,我们研究了一种针对该识别任务的中间、数据驱动方法。对于二进制删除信道,我们首先证明在特定温和假设下几乎可以必然正确识别所有DNA链。随后我们提出一种数据驱动剪枝流程,并证明该流程平均仅使用 M2\mathcal{M}^2 的一小部分数据比较。具体而言,对于 M=2n\mathcal{M}= 2^n 且删除概率为 pp,该流程执行的期望数据比较次数为 κM2\kappa\mathcal{M}^2,其中 (1+2pp22)nκ(1+p2)n\left(\frac{1+2p-p^2}{2}\right)^n \leq \kappa \leq \left(\frac{1+p}{2}\right)^n

关键词

引用

@article{arxiv.2305.04597,
  title  = {Data-Driven Bee Identification for DNA Strands},
  author = {Shubhransh Singhvi and Avital Boruchovsky and Han Mao Kiah and Eitan Yaakobi},
  journal= {arXiv preprint arXiv:2305.04597},
  year   = {2023}
}

备注

Conference paper accepted at ISIT 2023