中文

从像素到单词——向大规模原生单视觉模型迈进

计算机视觉与模式识别 2026-05-28 v1

摘要

当前的视觉语言模型(VLMs)通常通过多阶段对齐,将独立的图像编码器和语言解码器拼接在一起,这种模块化框架不可避免地将像素级信号在帧之间碎片化,并稀释了早期的像素-词互动。同时,尽管原生视觉模型在单张图像上展现了惊人的性能,但在多图像、视频理解和空间智能等领域仍 largely 未被探索。因此,我们引入了 NEO-ov,这是一个原生基础模型,通过端到端学习跨帧和像素-词对应关系,无需任何外部编码器、辅助适配器或后处理融合。通过彻底消除模块边界,NEO-ov 能够在模型内部自然地实现细粒度的统一时空建模。值得注意的是,NEO-ov 在细粒度视觉感知方面表现出色,基本缩小了与模块化方法的差距,这表明原生“单视觉”架构在大规模下不仅是可行的,而且具有竞争力。除了实证性能外,我们还揭示了系统性的架构分析和详细的训练配方,以促进后续的原生多模态建模。我们的代码和模型已公开:https://github.com/EvolvingLMMs-Lab/NEO

关键词

引用

@article{arxiv.2605.28820,
  title  = {From Pixels to Words -- Towards Native One-Vision Models at Scale},
  author = {Haiwen Diao and Jiahao Wang and Penghao Wu and Yuhao Dong and Yuwei Niu and Yue Zhu and Zhongang Cai and Weichen Fan and Linjun Dai and Silei Wu and Xuanyu Zheng and Mingxuan Li and Yuanhan Zhang and Bo Li and Hanming Deng and Huchuan Lu and Quan Wang and Lei Yang and Lewei Lu and Dahua Lin and Ziwei Liu},
  journal= {arXiv preprint arXiv:2605.28820},
  year   = {2026}
}

备注

13 pages, 6 figures