抗失真哈希用于相似DNA子序列的快速搜索
数据结构与算法
2016-02-19 v1 信息论
math.IT
摘要
生物信息学的基本任务之一是在长参考序列 (如人类geneome)中定位测序时读取的短子序列 。一种自然的快速方法是为 寻找哈希值,并将其与为 中每个长度为 的子序列预先准备的哈希值数据库进行比较。这种方法的问题在于它只能发现完全匹配,而现实中大量存在微小变化:替换、删除和插入。若拥有一个依据比对度量(如Needleman-Wunch)设计的可容忍某些小失真的哈希函数,该问题可得以解决:设计为使两个相似序列极可能给出相同哈希值。本文讨论抗失真哈希(DRH)的构造,以生成此类指纹用于相似子序列的快速搜索。所提方法基于率失真理论:在长度为 序列的近均匀子集中,哈希值表示与 最接近的序列。这可对碰撞距离(即具有相同哈希值的序列)进行一定控制。
引用
@article{arxiv.1602.05889,
title = {Distortion-Resistant Hashing for rapid search of similar DNA subsequence},
author = {Jarek Duda},
journal= {arXiv preprint arXiv:1602.05889},
year = {2016}
}
备注
5 pages, 4 figures