GaKCo:一种利用计数的快速带隙 k-mer 字符串核
机器学习
2017-09-19 v3 人工智能
计算复杂性
计算与语言
数据结构与算法
摘要
字符串核(SK)技术,尤其是那些使用带隙 -mer 作为特征(gk)的技术,在分类 DNA、蛋白质和文本等序列方面取得了巨大成功。然而,最先进的 gk-SK 在增大字典大小()或允许更多错配()时运行极慢。这是因为当前的 gk-SK 使用基于字典树(trie)的算法来计算错配子串的共现,导致时间成本与 成正比。我们提出了一种用于计算带隙 -mer 核(GaKCo)的快速算法,该算法利用计数(Counting)。GaKCo 使用关联数组通过累积计数来计算子串的共现。该算法快速、可扩展到更大的 和 ,并且天然可并行化。我们提供了将 GaKCo 与最先进的 gk-SK 进行比较的严格渐近分析。理论上,GaKCo 的时间成本独立于拖慢基于字典树方法的 项。实验上,我们观察到 GaKCo 达到了与最先进方法相同的准确率,并且在 DNA(5个数据集)、蛋白质(12个数据集)和基于字符的英文文本(2个数据集)序列分类上,速度分别提升了 2、100 和 4 倍。GaKCo 作为开源工具共享于 \url{https://github.com/QData/GaKCo-SVM}
引用
@article{arxiv.1704.07468,
title = {GaKCo: a Fast GApped k-mer string Kernel using COunting},
author = {Ritambhara Singh and Arshdeep Sekhon and Kamran Kowsari and Jack Lanchantin and Beilun Wang and Yanjun Qi},
journal= {arXiv preprint arXiv:1704.07468},
year = {2017}
}
备注
@ECML 2017