中文

QLIP:动态四叉树视觉先验在无需重训练的情况下提升 MLLM 性能

机器学习 2026-03-27 v2

摘要

多模态大语言模型(MLLMs)将图像编码为视觉 token,在共享的潜在空间中对齐视觉和文本信号,以促进跨模态表示学习。CLIP 模型是一个被广泛采用的基础视觉语言模型,其视觉编码器在 LLaVA 等 MLLM 的发展中发挥了关键作用。然而,CLIP 视觉编码器存在显著的局限性,包括被限制为只能处理固定输入分辨率,以及无法为不同的图像产生分离的嵌入。替换现有模型的视觉编码器通常会产生大量的计算成本,因为这种改变通常需要对整个模型流水线进行重训练。在本工作中,我们找出了 CLIP 视觉编码器局限性背后的两个因素:介观偏差和插值偏差。为了解决这些问题,我们提出了 QLIP,作为 CLIP 的直接替代品,只需几行代码即可与现有的 MLLM 无缝集成,并且无需重训练即可增强粗粒度和细粒度的视觉理解。QLIP 以图像四叉树为核心设计,用一种新颖的内容感知分块取代了标准的均匀网格分块。我们的实验结果表明,QLIP 提高了 LLaVA v1.5 模型系列在各种模型规模下的通用视觉问答准确率——无需对整个 MLLM 进行重训练或微调。值得注意的是,QLIP 在具有挑战性的 V-star 基准上将详细理解性能提升了高达 13.6%。

关键词

引用

@article{arxiv.2505.23004,
  title  = {QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining},
  author = {Kyle R. Chickering and Bangzheng Li and Muhao Chen},
  journal= {arXiv preprint arXiv:2505.23004},
  year   = {2026}
}

备注

Accepted as ICLR 2026 poster. 22 pages, 19 figures