在游程长度编码的HiFi读长集合中计算全对全最大精确匹配
数据结构与算法
2022-09-01 v1
摘要
我们描述了一种在含有同聚物错误的HiFi读长间寻找最大精确匹配(MEMs)的算法。我们工作的主要新颖之处在于借助游程长度压缩来帮助处理错误。我们的方法以包含HiFi读长及其反向互补的游程长度编码字符串集合作为输入。随后,它将编码拆分为两个数组,一个存储等符号游程的符号序列,另一个存储游程长度。拆分的目的在于获取游程符号的BWT并相应重排其长度。我们表明,该特殊BWT由于编码了HiFi读长及其反向互补,支持对HiFi读长的双向查询。接着,我们提出了Belazzougui等人(2013)的MEM算法的一个变体,其利用游程长度编码及我们BWT的隐式双向特性来计算近似MEM。具体而言,若算法发现两个子串 与 具有一个MEM,则仅当其对应长度序列 与 的差异不超过输入阈值时才报告该MEM。我们使用一种称为{\em 游程长度超出}的简单度量来计算长度序列的相似性。我们的技术便于检测含同聚物错误的MEM,因为它不需要动态规划来寻找仅以等符号游程长度为编辑位置的近似匹配。最后,我们提出了一种依赖几何数据结构来报告我们算法所检测MEM的文本出现位置的方法。
引用
@article{arxiv.2208.14787,
title = {Computing all-vs-all MEMs in run-length encoded collections of HiFi reads},
author = {Diego Díaz-Domínguez and Simon J. Puglisi and Leena Salmela},
journal= {arXiv preprint arXiv:2208.14787},
year = {2022}
}
备注
Accepted in SPIRE'22