从视觉到词汇:通过多模态大语言模型中的自回归预训练建立图像和文本标记的等价性
计算机视觉与模式识别
2025-02-14 v1
摘要
虽然多模态大语言模型在感知任务中表现良好,但缺乏精确的多模态对齐,限制了性能。为此,我们提出了一种名为视觉动态嵌入引导的预训练 (VDEP) 的混合自回归训练范式。该方法利用视觉编码器后续 MLP 中的动态嵌入,监督图像隐藏状态并将图像标记整合到自回归训练中。现有多模态大语言模型主要关注从文本输入中恢复信息,往往忽略有效处理图像数据的能力。相反,本工作的关键改进是将多模态对齐重新解释为从输入数据中恢复信息的过程,特别强调重构详细视觉特征。该方法无需架构修改即可无缝集成到标准模型中。在 13 个基准测试上,VDEP 的性能超过基线方法,超越了现有方法。
引用
@article{arxiv.2502.09093,
title = {From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs},
author = {Mingxiao Li and Fang Qu and Zhanpeng Chen and Na Su and Zhizhou Zhong and Ziyang Chen and Nan Du and Xiaolong Li},
journal= {arXiv preprint arXiv:2502.09093},
year = {2025}
}