FILA:细粒度视觉语言模型
计算机视觉与模式识别
2025-05-01 v3 人工智能
摘要
最近,越来越多关注多模态大语言模型(MLLM)处理高分辨率图像的能力。当前常见的方法是动态地将原始高分辨率图像裁剪成更小的子图像,然后输入到预训练于低分辨率图像的视觉编码器中。然而,这种裁剪方法常常会截断原始图像中的物体和连通区域,导致语义中断。为解决这一限制,我们提出了 HyViLM,旨在处理任意分辨率的图像,同时在编码过程中保留整体语境。具体地,我们:(i) 设计了新的视觉编码器称为 Hybrid Encoder,不仅编码单个子图像,还与详细的全局视觉特征进行交互,显著提高了模型处理高分辨率图像的能力。(ii) 提出了一种最优特征融合策略,用于动态裁剪方法,有效利用来自视觉编码器不同层的信息。与相同设置下的前沿 MLLM 相比,我们的 HyViLM 在九个十个任务中均表现出色。具体而言,HyViLM 在 TextVQA 任务上的性能提升了 9.6%,在 DocVQA 任务上的性能提升了 6.9%。
引用
@article{arxiv.2412.08378,
title = {FILA: Fine-Grained Vision Language Models},
author = {Shiding Zhu and Wenhui Dong and Jun Song and Yingbo Wang and Yanan Guo and Bo Zheng},
journal= {arXiv preprint arXiv:2412.08378},
year = {2025}
}
备注
9 pages, 4 figures, accepted to ICLR 2025 workshop