中文

谱文本融合:多模态时间序列预测的频率感知方法

机器学习 2026-02-04 v2 人工智能

摘要

多模态时间序列预测在实际应用中至关重要,决策依赖于数值数据和上下文信号。核心挑战在于有效地将时间上的数值模式与来自其他模态(如文本)中嵌入的上下文相结合。虽然大多数现有方法逐步地将文本特征与时间序列模式对齐,但忽略了来自上下文信息(如时间序列周期和动态变化)的多尺度时间影响。这种局部对齐与全局文本上下文之间的不匹配可以通过谱分解来解决,后者将时间序列分解为捕捉短期变化和长期趋势的频率分量。本文提出了 SpecTF 框架,通过频率域集成文本数据对时间序列的影响。该方法提取文本嵌入,投影到频率域,并通过轻量级跨注意力机制与时间序列的谱分量融合。这种方式可基于文本相关性自适应地重新加权频率带,然后映射回时间域进行预测。实验结果表明,SpecTF 在多样化的多模态时间序列数据集上显著优于最先进的模型,同时使用的参数数量也大幅减少。

关键词

引用

@article{arxiv.2602.01588,
  title  = {Spectral Text Fusion: A Frequency-Aware Approach to Multimodal Time-Series Forecasting},
  author = {Huu Hiep Nguyen and Minh Hoang Nguyen and Dung Nguyen and Hung Le},
  journal= {arXiv preprint arXiv:2602.01588},
  year   = {2026}
}