中文

VTBench: 基于图表表示的多模态时间序列分类框架

计算机视觉与模式识别 2026-05-01 v1 机器学习

摘要

时间序列分类(TSC)通过深度学习取得了显著进展,但大多数模型仅依赖原始数值输入,忽略了其他表示方法。虽然基于纹理的编码如Gramian Angular Fields(GAF)和Recurrence Plots(RP)将时间序列转换为2D图像,但常需繁重预处理且表征较少直观。相比之下,图表基可视化提供了更具解释性的替代方案,虽在特定领域显示出潜力,但其有效性仍未得到广泛探索,缺乏对不同图表类型、视觉编码选择和数据集的系统评估。本文我们引入VTBench,一个系统性且可扩展的框架,通过原始序列与图表基可视化的多模态融合重新审视TSC。VTBench生成轻量、人类可解释的图表——折线图、面积图、柱形图和散点图,为同一信号提供互补视图。我们开发了支持多种融合策略的模块化架构,包括单图视觉-数值融合、多图视觉融合和与原始输入结合的完整多模态融合。通过在31个UCR数据集上的实验,我们发现:(1)仅用图表的模型在特定情况下与实际竞争,尤其在小数据集上;(2)组合多种图表类型可提高准确率,通过捕获互补的视觉线索;(3)当视觉特征提供非冗余信息时,多模态模型可改善或维持性能,但若引入冗余则可能降低准确率。我们进一步提炼出实用指南,用于选择图表类型、融合策略和配置。VTBench为可解释且有效的多模态时间序列分类建立了统一基础。

关键词

引用

@article{arxiv.2604.27259,
  title  = {VTBench: A Multimodal Framework for Time-Series Classification with Chart-Based Representations},
  author = {Madhumitha Venkatesan and Xuyang Chen and Dongyu Liu},
  journal= {arXiv preprint arXiv:2604.27259},
  year   = {2026}
}

备注

8 pages main text