从 BOP 到 BOSS 及更远:基于字典的时间序列分类器
机器学习
2024-10-18 v1 机器学习
摘要
一类用于时间序列分类(TSC)的算法通过对每个序列运行滑动窗口、将窗口离散化为词、在字典上形成词频直方图,然后基于直方图构建分类器。近期对两类此类算法——模式袋(BOP)和符号傅里叶近似符号袋(BOSS)——的评估发现,这两种看似相似的算法在准确率上存在显著差异。我们通过解构这些分类器并度量 BOP 与 BOSS 之间四个关键组件的相对重要性来研究该现象。我们发现,尽管集成对两种算法都是关键组件,其他组件的影响则是混合且更为复杂的。我们得出结论:BOSS 代表了基于字典的 TSC 的当前最优(SOTA)。BOP 和 BOSS 均可归类为词袋方法。这些方法在图像分类等计算机视觉任务中尤为流行。将视觉中的方法迁移过来需要细致的工程设计。我们改编了计算机视觉中用于 TSC 的三种技术:尺度不变特征变换(SIFT)、空间金字塔和直方图相交。我们发现,将空间金字塔与 BOSS 结合(SP)可产生显著更准确的分类器。SP 显著优于标准基准和原始 BOSS 算法。它不显著劣于最佳基于形状段的办法,且仅被 HIVE-COTE(一种包含 BOSS 作为组成模块的集成方法)超越。
引用
@article{arxiv.1809.06751,
title = {From BOP to BOSS and Beyond: Time Series Classification with Dictionary Based Classifiers},
author = {James Large and Anthony Bagnall and Simon Malinowski and Romain Tavenard},
journal= {arXiv preprint arXiv:1809.06751},
year = {2024}
}