LLM-ABBA:通过符号近似理解时间序列
机器学习
2026-02-05 v5 人工智能
摘要
大语言模型 (LLM) 在时间序列上的成功已在前期工作中得到证明。利用符号时间序列表示,可以有效地弥合 LLM 与时间序列之间的鸿沟。然而,仍有的挑战是利用时间序列中隐藏的语义信息,并通过符号或现有 LLM 的 token 来实现这一目标,同时根据时间序列的隐藏信息调整 LLM 的嵌入空间。符号时间序列近似 (STSA) 方法——基于自适应布朗桥的符号聚合 (ABBA) 能够通过建模以振幅和周期为关键特征的时间序列模式,同时利用现有的 LLM token,展现出卓越的保护关键时间序列特征的效果。在本文中,我们提出了一种方法,称为 LLM-ABBA,将 ABBA 集成到大语言模型中,以解决各种下游时间序列任务。通过符号化时间序列,LLM-ABBA 在 UCR 数据集和三个医学时间序列分类任务中均表现出优于最新 SOTA 方法。同时,引入 ABBA 中的固定多边形链技巧,以显著缓解在从符号转换回数值时因误用符号导致的累积误差,从而避免预测任务中的明显漂移。在时间序列回归任务中,LLM-ABBA 在 Time Series Extrinsic Regression (TSER) 挑战基准上实现了新的 SOTA。LLM-ABBA 也显示出与最新 SOTA 时间序列预测结果相当的预测能力。我们认为,该框架可以顺利扩展到其他时间序列任务。我们的模拟代码已公开于:https://github.com/inEXASCALE/llm-abba
引用
@article{arxiv.2411.18506,
title = {LLM-ABBA: Understanding time series via symbolic approximation},
author = {Xinye Chen and Erin Carson and Cheng Kang},
journal= {arXiv preprint arXiv:2411.18506},
year = {2026}
}