基于区域兴趣链的视觉指令微调
计算机视觉与模式识别
2025-05-13 v1
摘要
高分辨率(HR)图像是提升多模态大语言模型(MLLM)识别与理解能力的关键因素。然而,直接增加图像分辨率会显著增加计算开销。本文提出了一种名为区域兴趣链(Chain of Region-of-Interest, CoRoI)的视觉指令微调方法,旨在减轻高分辨率图像对 MLLM 的计算负担。仿照人类视觉系统的选择性特性,我们认识到高分辨率图像中并非所有区域都等重要。CoRoI 旨在识别并优先处理最具信息量的区域,从而在无需处理冗长 HR 图像标记的情况下,增强多模态视觉理解与识别能力。通过在 11 个基准测试上的大量实验,我们验证了 CoRoI 在不同规模模型(7B 至 34B 参数)中的有效性。我们的模型在多样化的多模态基准测试和任务中均表现出优异性能。值得注意的是,我们的方法在几乎所有基准测试中超越 LLaVA-NeXT,且我们微调的 34B 模型在六个基准测试中超过了专有方法如 Gemini Pro 1.0,同时在 MMB、SEED-I 和 MME 上超越 GPT-4V。
引用
@article{arxiv.2505.06840,
title = {Visual Instruction Tuning with Chain of Region-of-Interest},
author = {Yixin Chen and Shuai Zhang and Boran Han and Bernie Wang},
journal= {arXiv preprint arXiv:2505.06840},
year = {2025}
}
备注
N/A