DiffCap-Bench:面向图像差异描述的全面、高难度与鲁棒基准
计算机视觉与模式识别
2026-05-07 v1 人工智能
摘要
图像差异描述(IDC)旨在生成自然语言描述以精确识别两幅图像之间的差异,是评估细粒度变化感知、跨模态推理及图像编辑数据构建的关键基准。然而,现有基准缺乏多样性与组合复杂性,且标准的词汇重叠指标(如BLEU、METEOR)无法捕捉语义一致性或惩罚幻觉,这些因素共同阻碍了对多模态大语言模型在IDC任务上的全面且鲁棒的评估。为填补这些空白,我们引入了DiffCap-Bench,一个涵盖十种不同差异类别的全面IDC基准,以确保多样性与组合复杂性。此外,我们提出了一种基于经人工验证的差异列表的LLM-as-a-Judge评估协议,从而对模型捕捉和描述视觉变化的能力进行鲁棒评估。通过对最先进的多模态大语言模型进行广泛评估,我们揭示了专有模型与开源模型之间显著的性能差距,强调了推理能力的关键重要性,并指出了模型缩放中的明确局限性。我们的框架还展现出与人类专家判断的高度一致性,以及与下游图像编辑数据构建质量的强相关性。这些发现确立了DiffCap-Bench既是一个可靠的IDC评估框架,也是下游实用性的有效预测器。该基准和代码将公开发布以支持进一步研究。
引用
@article{arxiv.2605.04503,
title = {DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning},
author = {Yuancheng Wei and Haojie Zhang and Linli Yao and Lei Li and Jiali Chen and Tao Huang and Yiting Lu and Duojun Huang and Xin Li and Zhao Zhong},
journal= {arXiv preprint arXiv:2605.04503},
year = {2026}
}