中文

DAPE:用于改进高效视觉语言模型性能的动态非均匀对齐与渐进细节增强技术

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

近年来,预训练视觉语言模型展现出巨大的潜力,成为众多下游任务的关键基础框架。然而,文本与图像之间的信息密度并非均匀分布。现有方法常常忽视文本标签与图像块之间固有的、动态的信息密度差异和语义范围差异。这些常规的统一对齐策略导致粗粒度的跨模态交互以及细粒度语义细节的丢失。此外,追求更细粒度的对齐通常需要巨大的计算开销,限制了实际模型的部署。为此,本文提出了一种用于动态跨模态对齐的新框架,实现持续的细节引入。首先,我们设计了一个动态自适应的跨模态匹配机制,该机制使用可学习的匹配函数,动态分配不同信息密度但相同大小的文本标签与图像标签之间的不同的数量和大小,以实现更精确的注意力交互。其次,我们开发了一个持续细节引入模块,用于逐步将高分辨率视觉特征增强纳入对齐过程。广泛的实验表明,在多个基准测试上,我们的方法在保持计算开销降低的同时,显著提高了各种下游任务的准确率。

关键词

引用

@article{arxiv.2605.08902,
  title  = {DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models},
  author = {Mengyuan Tian and Qiyan Zhao and Yanan Wang and Da-Han Wang},
  journal= {arXiv preprint arXiv:2605.08902},
  year   = {2026}
}

备注

Accepted in ICIC 2026 Oral