中文

多模态 LLM 中的视觉功能层

计算机视觉与模式识别 2025-09-30 v1

摘要

本研究发现,在多模态大语言模型中,与视觉相关的功能解码分布在不同的解码器层中。通常,每个功能(如计数、定位或 OCR 识别)会收敛到两到三层,我们将其定义为视觉功能层。此外,不同 VFL 的深度及其顺序在不同的 MLLM 中表现出一致的模式,这与人类行为高度吻合(例如,识别最先发生,其次是计数,然后是定位)。这些发现源于我们的新型分析框架 Visual Token Swapping,该框架通过修改特定的 KV cache 条目来精确阐明解码过程中各层的特定功能。此外,这些见解在为现实世界的下游应用定制 MLLM 方面提供了实质性的实用价值。例如,当 LoRA 训练被选择性地应用于其功能与训练数据相匹配的 VFL 时,VFL-LoRA 不仅优于全量 LoRA,还能防止域外功能遗忘。此外,通过分析特定 VFL 被消融时训练数据上的性能差异,VFL-select 能够按功能自动对数据进行分类,从而实现高效的数据选择以直接增强相应能力。因此,VFL-select 在数据选择上超越了人类专家,并仅使用原始数据集的 20% 就达到了全量数据 98% 的性能。本研究加深了对 MLLM 视觉处理的理解,促进了更高效、可解释且鲁棒的模型的创建。

关键词

引用

@article{arxiv.2509.24791,
  title  = {Vision Function Layer in Multimodal LLMs},
  author = {Cheng Shi and Yizhou Yu and Sibei Yang},
  journal= {arXiv preprint arXiv:2509.24791},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 (preview; camera-ready in preparation)