感知与语言的桥接:面向大型视觉语言模型的 amodal completion 报告系统性基准
计算与语言
2025-07-09 v1
摘要
开发大型视觉语言模型(LVLMs)的主要目标之一是构建能够帮助人类完成多模态任务的系统,例如解释感官经验的描述。一个核心现象就是amodal completion,即即使这些物体的部分被遮蔽,人们仍会感知到这些物体的存在。虽然已有大量研究评估了计算机视觉算法是否能够检测或重建被遮挡区域,但LVLMs对与amodal completion相关文本的推理能力尚未得到探索。为此,我们构建了一个基于Basic Formal Ontology的基准,以实现amodal completion的系统分类。我们的结果表明,虽然许多LVLMs在整体上实现了与人类相当的性能,但在某些类型物体的完成准确率存在差异。值得注意的是,在某些类别中,一些LLaVA-NeXt变体和Claude 3.5 Sonnet在原始图像上的准确率低于在无视觉内容的空白刺激物上的准确率。令人Intriguing的是,这一差异仅在日语提示下出现,这表明这些模型在日语特定语言能力方面存在不足。
引用
@article{arxiv.2507.05799,
title = {Bridging Perception and Language: A Systematic Benchmark for LVLMs' Understanding of Amodal Completion Reports},
author = {Amane Watahiki and Tomoki Doi and Taiga Shinozaki and Satoshi Nishida and Takuya Niikawa and Katsunori Miyahara and Hitomi Yanaka},
journal= {arXiv preprint arXiv:2507.05799},
year = {2025}
}
备注
To appear in the Proceedings of the 47th Annual Meeting of the Cognitive Science Society (COGSCI 2025)