MARVIS:面向可视化的模态自适应推理
机器学习
2026-04-30 v2
摘要
机器学习的预测应用通常依赖于小型(小于10亿参数)的专用模型,这些模型针对特定领域或模态进行微调。在这些模型中,虽然能够实现卓越的性能,但缺乏灵活性。大语言模型(Large Language Model, LLM)和视觉语言模型(Vision Language Model, VLM)提供了 versatility,但通常在非传统模态和长尾领域中表现不佳。我们提出MARVIS(Modality Adaptive Reasoning over VISualizations),是一个将潜在嵌入空间转换为视觉表示,然后利用视觉语言模型的空间和细粒度推理能力来解释可视化并成功地用于预测的系统。MARVIS在视觉、音频、生物和表格领域实现了具有竞争力的性能,使用单个3B参数模型,平均超过Gemini 2.0提升16%。MARVIS大幅缩小了LLM/VLM方法与特定领域方法之间的差距,无需任何领域特定训练即可实现。代码和数据集已公开于https://github.com/penfever/marvis。
引用
@article{arxiv.2507.01544,
title = {MARVIS: Modality Adaptive Reasoning over VISualizations},
author = {Benjamin Feuer and Lennart Purucker and Oussama Elachqar and Chinmay Hegde},
journal= {arXiv preprint arXiv:2507.01544},
year = {2026}
}