多模态大语言模型是否真正能理解小目标?
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
多模态大语言模型 (Multimodal Large Language Models, MLLMs) 在 diverse understanding 任务中展现出巨大的潜力,包括图像和视频分析、数学物理奥林匹克竞赛等。然而,对于小目标理解 (Small Object Understanding, SOU) 任务仍鲜有探索。为填补这一空白,我们引入 SOUBench——第一个综合性基准,用于探索现有 MLLMs 的小目标理解能力。具体而言,我们首先设计一种有效且自动化的视觉问答生成策略,构建新的 SOU-VQA 评估数据集,包含 18,204 个 VQA 对,六个相关子任务,以及三个主导场景(即驾驶、航拍及水下)。随后,我们对 15 个前沿 MLLMs 进行全面评估,揭示其在小目标理解方面存在显著弱势。进一步,我们开发了 SOU-Train,包含 11,226 个 VQA 对的多模态训练数据集,以提升 MLLMs 的小目标理解能力。通过对最新 MLLM 的超级微调,我们证明了 SOU-Train 能有效提升最新 MLLM 理解小目标的能力。综合实验结果表明,所提出的 SOUBench 基准,以及 SOU-VQA 和 SOU-Train 数据集,为社区提供了重要的实证基础,以进一步开发具备增强小目标理解能力的模型。数据集与代码: https://github.com/Hanfj-X/SOU。
引用
@article{arxiv.2604.22884,
title = {Can Multimodal Large Language Models Truly Understand Small Objects?},
author = {Fujun Han and Junan Chen and Xintong Zhu and Jingqi Ye and Xuanjie Mao and Tao Chen and Peng Ye},
journal= {arXiv preprint arXiv:2604.22884},
year = {2026}
}
备注
Under Peer Review (26 pages, 9 figures, 6 tables)