高效的多变量序列分类
机器学习
2014-10-01 v2
摘要
基于核函数的序列分类方法已成功应用于文本分类、图像分类、语音分析、生物序列分析、时间序列及音乐分类等多个领域,并展现出极高的准确性。这些领域中典型的序列核函数(如词袋、不匹配或子序列核)仅限于{\em 离散单变量}(即一维)字符串数据,例如文本分析中的词序列、图像分析中的码字序列,或 DNA 和蛋白质序列分析中的核苷酸或氨基酸序列。然而,原始序列数据通常具有实值多变量的性质,即不符合典型基于 -mer 的序列核函数所要求的单变量和离散特性。在本文中,我们研究了{\em 多变量}序列分类问题,例如多变量音乐序列分类或多维蛋白质序列表示分类。为此,我们扩展了序列分析中常用的{\em 单变量}核函数,并提出了一种高效的{\em 多变量}相似性核方法 (MVDFQ-SK)。该方法基于:(1) 对原始{\em 实值}多变量序列中每个序列维度进行直接特征量化 (DFQ);(2) 在这些多变量离散 DFQ 序列表示上应用新颖的多变量离散核度量,以更准确地捕捉序列间的相似性关系并提升分类性能。使用所提出的 MVDFQ-SK 核方法进行的实验表明,在三个具有挑战性的音乐分类任务以及蛋白质序列分类中,该方法表现出卓越的分类性能,相较于单变量核方法及现有的最先进 (SOTA) 序列分类方法,性能显著提升了 25-40%。
引用
@article{arxiv.1409.8211,
title = {Efficient multivariate sequence classification},
author = {Pavel P. Kuksa},
journal= {arXiv preprint arXiv:1409.8211},
year = {2014}
}
备注
multivariate sequence classification, string kernels, vector quantization, direct feature quantization, music classification, protein classification