中文

图表掌握多模态模型的时间序列理解

人工智能 2024-12-02 v2 计算机视觉与模式识别

摘要

虽然多模态基础模型现在可以原生地处理文本之外的数据,但在分析像医疗保健、金融和社会科学等领域中大量多维时间序列数据的能力仍被低估,这是一个被忽视的机会,可能为更丰富、数据驱动的见解提供动力。本文提出一种简单而有效的方法,通过利用这些模型现有的视觉编码器来“看到”通过图表表示的时间序列数据,从而避免需要额外可能昂贵的模型训练。我们的实证评估显示,这种方法优于以文本形式提供原始时间序列数据,此外,视觉时间序列表示还能将模型 API 成本降低最高可达90%。我们通过不断复杂化的合成数据任务验证了我们的假设,从简单的干净数据上的函数形式识别,到从噪声散点图中提取趋势。为了展示从具有清晰推理步骤的合成任务到更复杂、真实世界情景的可泛化性,我们将方法应用于消费者健康任务——具体来说是跌倒检测、活动识别和准备情况评估——这些任务涉及异构数据和多步骤推理。在GPT和Gemini模型家族中,plot性能优于text性能(在零样本合成任务中提升最高可达120%,在真实世界任务中提升最高可达150%),凸显了该方法在充分利用基础模型本机能力方面的潜力。

关键词

引用

@article{arxiv.2410.02637,
  title  = {Plots Unlock Time-Series Understanding in Multimodal Models},
  author = {Mayank Daswani and Mathias M. J. Bellaiche and Marc Wilson and Desislav Ivanov and Mikhail Papkov and Eva Schnider and Jing Tang and Kay Lamerigts and Gabriela Botea and Michael A. Sanchez and Yojan Patel and Shruthi Prabhakara and Shravya Shetty and Umesh Telang},
  journal= {arXiv preprint arXiv:2410.02637},
  year   = {2024}
}

备注

57 pages