面向DNA链的数据驱动蜂群识别
信息论
2023-05-09 v1 math.IT
摘要
我们研究了一种面向DNA链蜂群识别问题的数据驱动方法。蜂群识别问题由Tandon等人(2019)提出,要求通过一组 个含噪测量来识别 只蜂,每只蜂由唯一条形码标记。后来,Chrisnata等人(2022)将该模型扩展至对每只蜂观测 个含噪测量的情况,并将该模型应用于解决DNA存储系统的无序特性。在此类系统中,通常将唯一地址前置到每个DNA数据块以形成DNA链,但该地址可能受损。虽然聚类通常用于识别DNA链的地址,但这需要 次数据比较(当 为读取数时)。相比之下,Chrisnata等人(2022)的方法完全避免了数据比较。本工作中,我们研究了一种针对该识别任务的中间、数据驱动方法。对于二进制删除信道,我们首先证明在特定温和假设下几乎可以必然正确识别所有DNA链。随后我们提出一种数据驱动剪枝流程,并证明该流程平均仅使用 的一小部分数据比较。具体而言,对于 且删除概率为 ,该流程执行的期望数据比较次数为 ,其中 。
引用
@article{arxiv.2305.04597,
title = {Data-Driven Bee Identification for DNA Strands},
author = {Shubhransh Singhvi and Avital Boruchovsky and Han Mao Kiah and Eitan Yaakobi},
journal= {arXiv preprint arXiv:2305.04597},
year = {2023}
}
备注
Conference paper accepted at ISIT 2023