dna2vec:变长 k-mer 的一致向量表示
定量方法
2017-01-24 v1 计算与语言
机器学习
机器学习
摘要
长DNA序列一种普遍的表示方法是将其划分为较短的 k-mer 组分。遗憾的是,将 k-mer 作为 one-hot 向量进行直接向量编码易受维数灾难的影响。更糟糕的是,任意一对 one-hot 向量之间的距离都是等距的。这在将最新机器学习算法应用于解决生物序列分析问题时尤为成问题。本文中,我们提出一种新颖的方法来训练变长 k-mer 的分布式表示。我们的方法基于流行的词嵌入模型 word2vec,其在一个浅层两层神经网络上训练。我们的实验提供的证据表明,dna2vec 向量的求和类似于核苷酸的拼接。我们还证明了 Needleman-Wunsch 相似度分数与 dna2vec 向量的余弦相似度之间存在相关性。
引用
@article{arxiv.1701.06279,
title = {dna2vec: Consistent vector representations of variable-length k-mers},
author = {Patrick Ng},
journal= {arXiv preprint arXiv:1701.06279},
year = {2017}
}
备注
10 pages, 3 figures, 2 tables