中文

NEMO:多模态 LLM 能否识别属性修改后的对象?

计算机视觉与模式识别 2024-11-28 v1

摘要

多模态大语言模型(MLLM)在视觉理解方面取得了显著进展,但其识别被特定属性修改后对象的能力仍是未开放的问题。为此,我们探索了 MLLM 在对象识别中的推理能力,涵盖常识场景及超常识场景。我们引入了一个新基准,NEMO,包含 900 张原始水果图像及其对应的属性修改后图像;以及 2700 组问题,包括开放式、多选式、不可解答类型等。我们评估了 26 个近期开源及商业模型。结果显示,NEMO 中识别对象的表现存在显著差距,并揭示了不同模型在答案偏好方面的差异。尽管更强的视觉编码器提升了表现,但 MLLM 仍落后于独立视觉编码器。有趣的是,模型规模扩大并不一定带来更好结果,深入分析显示,更大的 LLM 在微调期间可能削弱视觉编码器。这为当前 MLLM 的关键局限性提供了洞见,并指向开发更灵活和韧性更好的多模态模型的潜在路径。

关键词

引用

@article{arxiv.2411.17794,
  title  = {NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?},
  author = {Jiaxuan Li and Junwen Mo and MinhDuc Vo and Akihiro Sugimoto and Hideki Nakayama},
  journal= {arXiv preprint arXiv:2411.17794},
  year   = {2024}
}