中文

Innovator-VL:面向科学发现的多模态大语言模型

计算机视觉与模式识别 2026-01-28 v1 人工智能

摘要

我们提出Innovator-VL,一个科学多模态大语言模型,旨在推动对多样化科学领域的理解与推理,同时保持在通用视觉任务上的卓越性能。与依赖大规模领域特定预训练和不透明管道的趋势相反,我们的工作表明,原则性的训练设计和透明的方法论即可在数据要求大幅降低的情况下,获得强大的科学智能。(i)首先,我们提供一个 fully transparent、end-to-end可复现的训练管道,涵盖数据收集、清洗、预处理、监督微调、强化学习以及评估,并附带详细的优化配方。这有助于社区进行系统性扩展。(ii)其次,Innovator-VL在数据效率方面表现突出,在使用少于五百万个精心挑选的样本(无大规模预训练)的情况下,就能在 various scientific tasks 上达到竞争性能。这些结果凸显了通过原则性的数据选择而非泛滥式扩张,即可实现有效推理。(iii)再者,Innovator-VL在 general vision、multimodal reasoning以及 scientific benchmarks 上均表现出色,显示出在不损害通用功能的前提下,可以将科学对齐整合到统一模型中。我们的做法表明,即便没有大规模数据,亦可构建出高效、可复现且性能卓越的科学多模态模型,为未来研究提供了可行的基础。

关键词

引用

@article{arxiv.2601.19325,
  title  = {Innovator-VL: A Multimodal Large Language Model for Scientific Discovery},
  author = {Zichen Wen and Boxue Yang and Shuang Chen and Yaojie Zhang and Yuhang Han and Junlong Ke and Cong Wang and Yicheng Fu and Jiawang Zhao and Jiangchao Yao and Xi Fang and Zhen Wang and Henxing Cai and Lin Yao and Zhifeng Gao and Yanhui Hong and Nang Yuan and Yixuan Li and Guojiang Zhao and Haoyi Tao and Nan Wang and Han Lyu and Guolin Ke and Ning Liao and Xiaoxing Wang and Kai Chen and Zhiyu Li and Feiyu Xiong and Sihan Hu and Kun Chen and Yanfeng Wang and Weinan E and Linfeng Zhang and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2601.19325},
  year   = {2026}
}

备注

Innovator-VL tech report