中文

迈向 MLLM 的无标注验证:一种视觉-语言逻辑一致性度量

人工智能 2026-05-08 v1

摘要

主流的准确率评估可能会奖励大型语言模型无根据的猜测,并且在没有真实标注的情况下,可能不适用于新任务的模型验证。基于基本逻辑原理,我们提出了一个新框架,在充分和必要因果关系上评估 MLLM 的视觉-语言逻辑一致性。我们在传统的 MC-VQA 测试和最近的 NaturalBench 测试上定义了视觉-语言逻辑一致性度量(VL-LCM),且无需真实标注。通过对代表性视觉-语言基准 MMMU 以及最近的视觉-语言挑战(如 NaturalBench)进行系统实验,我们评估了来自 4 个前沿系列的 11 个近期开源 MLLM。我们的研究结果表明,尽管近期 MLLM 在准确率上取得了显著进展,但逻辑一致性明显滞后。对 VL-LCM 与真实标注上指标的相关性、LCM 的可靠性以及 VL-LCM 与响应分布关系的广泛评估,证明了 VL-LCM 即使在没有真实标注的情况下也具有有效性和适用性。我们的研究结果表明,除了准确率之外,逻辑一致性也可用于衡量准确率和可靠性。VL-LCM 还可用于在没有真实标注的新任务中进行 MLLM 选择、验证和可靠的答案论证。

关键词

引用

@article{arxiv.2605.06201,
  title  = {Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric},
  author = {Ying Gu and Mei Chee Leong and Hui Li Tan and Shangbo Mao and Liyuan Li and Nancy Chen},
  journal= {arXiv preprint arXiv:2605.06201},
  year   = {2026}
}