中文

桥接视觉-语言模型中的隐藏状态

计算机视觉与模式识别 2025-11-17 v1

摘要

视觉-语言模型 (VLM) 是一类将图像内容与自然语言对齐的模型。现有方法通常通过以下方式进行融合:(a) 早期融合:在编码器内部混合 token/特征;或 (b) 晚期融合:通过比较池化嵌入。许多方法还将融合绑定到自回归解码器上。然而,两种模态的隐藏状态已经携带丰富的模态特定结构(视觉中为空间布局;文本中为语法和语义),因此直接对齐这些隐藏状态是一种自然的匹配方式。我们提出一种轻量级融合模块:置于两个编码器顶部的若干个仅跨模态的双向注意力层。每个层将视觉和文本编码器的隐藏状态序列投影到共享空间,跨模态注意,然后通过带门控残差更新将信息返回,并配以简单稳定器以提高对齐效果。编码器保持非因果且强大的理解能力,而生成通过可选解码器实现干净的解耦。在标准检索、VQA 和视觉推理基准测试中,BRIDGE 在 comparable VLM 基础上超越,且保留了对比模型的双编码器效率。我们已在 https://github.com/jfeinashley/BRIDGE 公开代码。

关键词

引用

@article{arxiv.2511.11526,
  title  = {Bridging Hidden States in Vision-Language Models},
  author = {Benjamin Fein-Ashley and Jacob Fein-Ashley},
  journal= {arXiv preprint arXiv:2511.11526},
  year   = {2025}
}