基于最大匹配序列上下文的直系同源基因
定量方法
2015-11-24 v2 基因组学
摘要
依赖于上下文的直系同源基因鉴定通常依赖于保守的基因顺序或全基因组序列比对。本文表明,短程上下文——短至单个最大匹配——也为在全基因组内鉴定直系同源基因提供了有效手段。在原始(未进行重复序列屏蔽)的哺乳动物全基因组组装上,我们执行一种基因组“交集”操作,其消耗的计算时间通常不到常用全基因组比对方法所需时间的三十分之一,并提取“非嵌入最大匹配”,即那些不被其他最大匹配所包含的最大匹配,作为潜在的直系同源基因。通过非嵌入最大匹配鉴定的直系同源基因类似于先前文献中定义的“位置直系同源基因”或“初级直系同源基因”;这类直系同源基因构成了源自同一直接祖先且其在基因组中的祖先位置得以保守的同源基因。在核苷酸水平上,非嵌入最大匹配重现了Lastz网络比对所识别的大多数精确匹配。在基因水平上,包含非嵌入最大匹配的基因的相互最佳命中以高选择性和高灵敏度恢复了Ensembl Compara注释的一对一直系同源基因;这些相互最佳命中还额外包含了Ensembl中未发现的推定新直系同源基因(例如,人类/黑猩猩之间超过两千个)。该方法特别适用于全基因组范围的直系同源基因鉴定。
引用
@article{arxiv.1509.04412,
title = {Orthologs from maxmer sequence context},
author = {Kun Gao and Jonathan Miller},
journal= {arXiv preprint arXiv:1509.04412},
year = {2015}
}