中文

WEASEL 2.0——一种用于快速、准确且内存受限时间序列分类的随机膨胀字典变换

机器学习 2023-02-02 v2

摘要

时间序列是按时间顺序排序的实数值序列。时间序列分类(TSC)是将时间序列分配给一组预定义类别中的某一类的任务,通常基于从样本中学习的模型。基于字典的 TSC 方法依赖于统计时间序列中某些模式的频率,是当前最准确的 TSC 集成方法的重要组成部分。早期的基于字典的方法之一是 WEASEL,它在当时取得了 SotA 结果,同时也非常快速。然而,无论在速度还是准确性上,它都被其他方法超越。此外,其设计导致不可预测的大内存占用,使其在许多应用中无法使用。在本文中,我们提出 WEASEL 2.0,一种基于 TSC 中两项近期进展对 WEASEL 的彻底重构:膨胀(dilation)与随机超参数设置的集成。这两种技术使 WEASEL 2.0 能够以固定大小的内存占用工作,同时提高准确性。与 UCR 基准集上的其他 15 种 SotA 方法相比,WEASEL 2.0 显著优于其他字典方法,且与当前最佳方法相比无显著差异。实际上,它在所有数据集上取得了最高的中位准确率,并在 12 个问题类别中的 5 类中表现最佳。因此我们相信 WEASEL 2.0 是当前 TSC 的可行替代方案,也是未来集成中潜在有趣的输入。

关键词

引用

@article{arxiv.2301.10194,
  title  = {WEASEL 2.0 -- A Random Dilated Dictionary Transform for Fast, Accurate and Memory Constrained Time Series Classification},
  author = {Patrick Schäfer and Ulf Leser},
  journal= {arXiv preprint arXiv:2301.10194},
  year   = {2023}
}