以多模态语言建模推进时间序列分类
机器学习
2024-03-20 v1
摘要
为推进时间序列分类的发展,审视以往研究,大多数现有方法采用一种通用的“学习-分类”范式——时间序列分类器模型试图学习序列输入与由独热分布编码的目标标签之间的关系。尽管有效,该范式隐藏了两个内在局限:(1) 用独热分布编码目标类别无法反映标签间的可比性与相似性;(2) 很难学到跨领域可迁移的模型,这极大阻碍了通用服务范式的发展。本工作提出 InstructTime,一种将时间序列分类重塑为“学习-生成”范式的新尝试。借助预训练语言模型强大的生成能力,核心思想是将时间序列分类形式化为多模态理解任务,其中任务特定指令与原始时间序列均作为多模态输入,而标签信息由文本表示。为实现此目标,InstructTime 设计了三个独特组件。首先,设计时间序列离散化模块,将连续时间序列转换为硬令牌序列,以解决跨模态输入的不一致问题。为解决模态表示鸿沟问题,一方面,在将转换后的时间序列令牌馈入语言模型前引入对齐投影层;另一方面,我们强调跨领域自回归预训练的必要性,这有助于提升语言模型的可迁移性并增强泛化性能。在基准数据集上进行大量实验,结果揭示了 InstructTime 的优越性能及其作为时间序列分类通用基础模型的潜力。
引用
@article{arxiv.2403.12371,
title = {Advancing Time Series Classification with Multimodal Language Modeling},
author = {Mingyue Cheng and Yiheng Chen and Qi Liu and Zhiding Liu and Yucong Luo},
journal= {arXiv preprint arXiv:2403.12371},
year = {2024}
}