中文

GaKCo:一种利用计数的快速带隙 k-mer 字符串核

机器学习 2017-09-19 v3 人工智能 计算复杂性 计算与语言 数据结构与算法

摘要

字符串核(SK)技术,尤其是那些使用带隙 kk-mer 作为特征(gk)的技术,在分类 DNA、蛋白质和文本等序列方面取得了巨大成功。然而,最先进的 gk-SK 在增大字典大小(Σ\Sigma)或允许更多错配(MM)时运行极慢。这是因为当前的 gk-SK 使用基于字典树(trie)的算法来计算错配子串的共现,导致时间成本与 O(ΣM)O(\Sigma^{M}) 成正比。我们提出了一种用于计算带隙 kk-mer 核(GaKCo)的快速算法,该算法利用计数(Counting)。GaKCo 使用关联数组通过累积计数来计算子串的共现。该算法快速、可扩展到更大的 Σ\SigmaMM,并且天然可并行化。我们提供了将 GaKCo 与最先进的 gk-SK 进行比较的严格渐近分析。理论上,GaKCo 的时间成本独立于拖慢基于字典树方法的 ΣM\Sigma^{M} 项。实验上,我们观察到 GaKCo 达到了与最先进方法相同的准确率,并且在 DNA(5个数据集)、蛋白质(12个数据集)和基于字符的英文文本(2个数据集)序列分类上,速度分别提升了 2、100 和 4 倍。GaKCo 作为开源工具共享于 \url{https://github.com/QData/GaKCo-SVM}

关键词

引用

@article{arxiv.1704.07468,
  title  = {GaKCo: a Fast GApped k-mer string Kernel using COunting},
  author = {Ritambhara Singh and Arshdeep Sekhon and Kamran Kowsari and Jack Lanchantin and Beilun Wang and Yanjun Qi},
  journal= {arXiv preprint arXiv:1704.07468},
  year   = {2017}
}

备注

@ECML 2017