中文

通过定制智能体推理增强视觉语言模型以实现少样本多模态时间序列分类

人工智能 2026-05-19 v2 机器学习 多智能体系统 多媒体

摘要

本文提出了首个用于少样本多模态时间序列分类(MarsTSC\textbf{MarsTSC})的视觉语言模型(VLM)智能体推理框架,该框架引入了一个自演化知识库作为动态上下文,通过反思性智能体推理进行迭代优化。该框架包含三个协作角色:i) 生成器通过推理进行可靠分类;ii) 反思器诊断推理错误的根本原因,以产生针对生成器所忽略的时序特征的判别性见解;iii) 修改器对知识库应用经验证的更新以防止上下文崩溃。我们进一步引入了测试时更新策略,以实现谨慎、连续的知识库优化,从而缓解少样本偏差和分布偏移。在12个主流时间序列基准上的广泛实验表明,MarsTSC\textbf{MarsTSC}在6个VLM骨干网络上取得了显著且一致的性能提升,在少样本条件下优于经典和基于基础模型的时间序列基线,同时生成了可解释的依据,将每个分类决策建立在人类可读的特征证据之上。

关键词

引用

@article{arxiv.2605.09395,
  title  = {Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning},
  author = {Lin Li and Jiawei Huang and Qihao Quan and Dan Li and Boxin Li and Xiao Zhang and Erli Meng and Wenjie Feng and Jian Lou and See-Kiong Ng},
  journal= {arXiv preprint arXiv:2605.09395},
  year   = {2026}
}

备注

18 pages, 12 figures, 6 tables. Preprint