中文

基于序列相似度与上下文的向量嵌入用于改进cDNA文库的压缩、相似搜索、聚类、组织与操作

基因组学 2023-08-11 v1 机器学习

摘要

本文展示了在涉及扁平字符串基因格式(即FASTA/FASTQ5)的研究中,基因的有组织数值表示的效用。FASTA/FASTQ文件目前存在若干局限,如文件体积大、映射与比对处理速度慢以及上下文依赖。这些挑战严重阻碍了涉及寻找相似序列的研究与任务。解决方案在于将序列转换为一种替代表示,相比原始序列本身更便于聚类为相似组。通过为每个短序列分配唯一的向量嵌入,可更高效地对cDNA文库的字符串表示进行聚类并提升压缩性能。此外,通过学习基于密码子三联体上下文的替代坐标向量嵌入,我们可展示基于氨基酸性质的聚类。最后,利用该序列嵌入方法对条形码和cDNA序列进行编码,通过将向量嵌入与一种判定欧氏空间中向量邻近度的算法相结合,可改善相似搜索的时间复杂度;这使我们能以更快速、更模块化的方式进行序列相似性搜索。

关键词

引用

@article{arxiv.2308.05118,
  title  = {Vector Embeddings by Sequence Similarity and Context for Improved Compression, Similarity Search, Clustering, Organization, and Manipulation of cDNA Libraries},
  author = {Daniel H. Um and David A. Knowles and Gail E. Kaiser},
  journal= {arXiv preprint arXiv:2308.05118},
  year   = {2023}
}

备注

15 pages, 8 figures