中文

重思时间序列多模态融合:辅助模态需要受约束的融合

机器学习 2026-03-25 v1 人工智能

摘要

近期多模态学习的进展促使将文本或视觉等辅助模态整合到时间序列(TS)预测中。然而,大多数现有方法往往只能获得有限的提升,仅在特定数据集中改进性能,或依赖于特定架构的设计限制了其泛化能力。本文指出,采用简单融合策略(如简单相加或拼接)的多模态模型往往低于单模态TS模型,这归因于未受控制地整合可能引入无关信息的辅助模态。为此,我们探索了各种受约束融合方法,以控制此类整合,发现其始终优于简单融合方法。此外,我们提出受控融合适配器(CFA),一种无需修改TS骨干网络即可实现受控跨模态交互的简单插件,仅整合与TS动态相匹配的相关文本信息。CFA采用低秩适配器筛选无关文本信息后再融合至时序表示中。我们在各种数据集和TS/文本模型上进行了超过2万次实验,证明了受约束融合方法(包括CFA)的有效性。代码已公开,地址为:https://github.com/seunghan96/cfa/。

关键词

引用

@article{arxiv.2603.22372,
  title  = {Rethinking Multimodal Fusion for Time Series: Auxiliary Modalities Need Constrained Fusion},
  author = {Seunghan Lee and Jun Seo and Jaehoon Lee and Sungdong Yoo and Minjae Kim and Tae Yoon Lim and Dongwan Kang and Hwanil Choi and SoonYoung Lee and Wonbin Ahn},
  journal= {arXiv preprint arXiv:2603.22372},
  year   = {2026}
}