面向多模态大语言模型图像描述能力的图像-文本-图像评估框架 ITIScore
计算机视觉与模式识别
2026-04-14 v2
摘要
近期多模态大语言模型(MLLMs)的进展大大提高了图像理解和描述能力。然而,现有的图像描述基准通常 suffer from caption length limited diversity, absence of recent advanced MLLMs, and insufficient human annotations,这可能引入偏见并限制对现代 MLLMs 性能的全面评估。为此,我们提出一种新型大规模图像描述基准,称为 ICBench,覆盖 12 个内容类别,包含由 10 个先进 MLLMs 在 2K 张图像上生成的短标题和长标题,总计 40K 条描述。我们进行大规模主观研究,通过细粒度评估维度获得 mean opinion scores (MOS),其中短描述在流畅性、相关性和简洁性方面评估,长描述在流畅性、相关性和完整性方面评估。此外,我们提出一种自动评估指标 ITIScore,基于图像-文本-图像框架,through reconstruction consistency 测量描述质量。实验结果显示,我们的自动指标与人类判断之间有强大的对齐性,以及在其他公开描述数据集上具有鲁棒的 zero-shot 泛化能力。该数据集和模型将在发表后发布。
引用
@article{arxiv.2604.03765,
title = {ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs},
author = {Zitong Xu and Huiyu Duan and Shengyao Qin and Guangyu Yang and Guangji Ma and Xiongkuo Min and Ke Gu and Guangtao Zhai and Patrick Le Callet},
journal= {arXiv preprint arXiv:2604.03765},
year = {2026}
}