中文

区域级上下文感知多模态理解

计算机视觉与模式识别 2025-09-01 v2 人工智能

摘要

尽管取得了显著进展,现有多模态大语言模型(MLLMs)的研究主要集中于通用视觉理解,忽视了整合与对象相关的文本上下文以实现更具上下文感知能力的多模态理解——我们将这种能力称为区域级上下文感知多模态理解(RCMU)。为解决这一局限,我们首先定义了RCMU任务,该任务要求模型通过整合图像内容以及区域或对象的文本信息来响应用户指令。为使MLLM具备RCMU能力,我们提出了区域级上下文感知视觉指令微调(RCVIT),该方法将对象信息融入模型输入,并使模型能够利用边界框坐标有效关联对象的视觉内容与其文本信息。为解决数据集匮乏问题,我们引入了RCMU数据集,这是一个覆盖多种RCMU任务的大规模视觉指令微调数据集。我们还提出了RC&P-Bench,这是一个能够评估MLLM在RCMU和多模态个性化理解任务中性能的综合基准。此外,我们提出了一种无参考评估指标,用于对区域级上下文感知图像描述进行全面且细粒度的评估。通过在Qwen2-VL模型上使用RCMU数据集执行RCVIT,我们开发了RC-Qwen2-VL模型。实验结果表明,RC-Qwen2-VL模型不仅在多个RCMU任务上取得了卓越性能,还在多模态RAG和个性化对话中展示了成功应用。我们的数据、模型和基准可在https://github.com/hongliang-wei/RC-MLLM获取。

关键词

引用

@article{arxiv.2508.12263,
  title  = {Region-Level Context-Aware Multimodal Understanding},
  author = {Hongliang Wei and Xianqi Zhang and Xingtao Wang and Xiaopeng Fan and Debin Zhao},
  journal= {arXiv preprint arXiv:2508.12263},
  year   = {2025}
}

备注

12 pages, 6 figures