从像素到文字——迈向大规模原生视觉语言原语
计算机视觉与模式识别
2026-02-24 v2 人工智能
摘要
原生视觉语言模型(VLM)的构建已成为典型模块化VLM的有力竞争者,其发展受到不断演进的模型架构和训练范式的塑造。然而,两个挥之不去的疑云为其广泛探索和推广蒙上了阴影:(-) 哪些基本限制将原生VLM与模块化VLM区分开来,这些障碍能在多大程度上被克服?(-) 如何使原生VLM的研究更易于获取和普及,从而加速该领域的进展?在本文中,我们阐明了这些挑战,并概述了构建原生VLM的指导原则。具体来说,一个原生VLM原语应该:(i) 在共享语义空间内有效对齐像素和文字表示;(ii) 无缝集成先前分离的视觉和语言模块的优势;(iii) 内在地体现支持统一视觉语言编码、对齐和推理的各种跨模态属性。因此,我们推出了NEO,一个从第一性原理构建的新型原生VLM家族,大大缩小了在多样化真实世界场景中与顶级模块化对应物的差距。凭借3.9亿图像-文本示例,NEO从零开始高效地发展视觉感知,同时减轻了我们精心设计的原语构建的密集单一模型内部的视觉语言冲突。我们将NEO定位为可扩展且强大的原生VLM开发的基石,并配有一套丰富的可重用组件,以培育一个经济高效且可扩展的生态系统。我们的代码和模型可在 https://github.com/EvolvingLMMs-Lab/NEO 公开获取。
引用
@article{arxiv.2510.14979,
title = {From Pixels to Words -- Towards Native Vision-Language Primitives at Scale},
author = {Haiwen Diao and Mingxuan Li and Silei Wu and Linjun Dai and Xiaohua Wang and Hanming Deng and Lewei Lu and Dahua Lin and Ziwei Liu},
journal= {arXiv preprint arXiv:2510.14979},
year = {2026}
}
备注
21 pages, 8 figures, Accepted by ICLR2026