中文

CaptionQA:你的图像描述是否与图像本身一样有用?

计算机视觉与模式识别 2026-04-17 v2

摘要

图像描述在多模态系统(如检索、推荐和多步智能体推理流程)中充当视觉内容的高效替代品。然而,当前的评估实践忽略了一个根本性问题:图像描述能否在实际下游任务中替代图像?我们提出了一个基于效用的基准测试 CaptionQA,用于评估模型生成的图像描述,其中描述质量通过其支持下游任务的程度来衡量。CaptionQA 是一个可扩展的、领域相关的基准测试,涵盖 4 个领域——自然、文档、电子商务和具身人工智能——每个领域都有细粒度的分类法(25 个顶级类别和 69 个子类别),用于识别领域特定任务的有用信息。CaptionQA 构建了 33,027 个密集标注的多项选择题(平均每张图像 50.3 个问题),这些问题明确需要视觉信息才能回答,从而对描述效用进行了全面的探测。在我们的评估协议中,一个 LLM 仅使用描述来回答这些问题,直接衡量描述是否保留了图像级别的效用,并且能否被下游 LLM 利用。对最先进的 MLLM 的评估揭示了图像与其描述效用之间的巨大差距。值得注意的是,在传统图像问答基准测试上几乎相同的模型,其描述效用最多降低了 32%。我们发布了 CaptionQA 以及一个用于扩展到新领域的开源流程。代码可在 https://github.com/bronyayang/CaptionQA 获取。

关键词

引用

@article{arxiv.2511.21025,
  title  = {CaptionQA: Is Your Caption as Useful as the Image Itself?},
  author = {Shijia Yang and Yunong Liu and Bohan Zhai and Ximeng Sun and Zicheng Liu and Emad Barsoum and Manling Li and Chenfeng Xu},
  journal= {arXiv preprint arXiv:2511.21025},
  year   = {2026}
}