中文

通过跨层区域注意力对齐优化视觉语言一致性

计算机视觉与模式识别 2025-08-05 v1

摘要

视觉语言模型 (VLM) 面临有效协调跨模态嵌入学习中不同注意力机制的挑战,导致注意力不匹配和次优性能。我们提出 Consistent Cross-layer Regional Alignment (CCRA),其引入 Layer-Patch-wise Cross Attention (LPWCA) 通过联合加权 patch 和 layer-wise 嵌入来捕获细粒度区域-语义相关性,并采用 Progressive Attention Integration (PAI) 系统性地协调 LPWCA、layer-wise 和 patch-wise 注意力机制。这种渐进式设计确保从语义到区域层面的一致性,同时防止注意力漂移并最大化 individual attention 的优势。在十个多样化视觉语言基准测试上的实验结果表明,我们的 CCRA 增强版 LLaVA-v1.5-7B 模型实现了最先进的性能,超过所有基线方法,仅增加 355 万参数,同时通过更具区域性和语义对齐的注意力模式提供了增强的可解释性。

关键词

引用

@article{arxiv.2508.00945,
  title  = {Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment},
  author = {Yifan Wang and Hongfeng Ai and Quangao Liu and Maowei Jiang and Ruiyuan Kang and Ruiqi Li and Jiahua Dong and Mengting Xiao and Cheng Jiang and Chenzhong Li},
  journal= {arXiv preprint arXiv:2508.00945},
  year   = {2025}
}

备注

10 pages