CAPability:面向视觉描述的全面基准测试:评估正确性与完整性
计算机视觉与模式识别
2025-11-27 v4 计算与语言
机器学习
摘要
视觉描述基准测试已过时,因现代多模态大语言模型(MLLM)的出现,简短的 ground-truth 句子和传统指标无法有效评估详细的描述。虽然最近的基准测试试图通过关注关键词提取或以对象为中心进行评估来解决此问题,但它们仅限于模糊视图或对象视图分析,以及不完整的视觉元素覆盖。本文引入 CAPability,一个覆盖 12 个维度、分为六个关键视图的综合性多视图基准测试,用于评估视觉描述。我们策划了近 1.1 万张人工标注的图像和视频,配有视觉元素标注,以评估生成的描述。CAPability 通过 \textit{precision} 和 \textit{hit} 指标稳定地评估描述的正确性和完整性。通过将标注转换为 QA 对,我们进一步引入了一种启发式指标 \textit{know but cannot tell}(),指示 QA 与描述能力之间的显著性能差距。我们的工作提供了 MLLM 描述能力全面分析,识别了其在各个维度上的优势与弱点,为未来研究在特定能力方面提升提供了指引。
引用
@article{arxiv.2502.14914,
title = {CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness},
author = {Zhihang Liu and Chen-Wei Xie and Bin Wen and Feiwu Yu and Jixuan Chen and Pandeng Li and Boqiang Zhang and Nianzu Yang and Yinglu Li and Zuan Gao and Yun Zheng and Hongtao Xie},
journal= {arXiv preprint arXiv:2502.14914},
year = {2025}
}
备注
Accepted to NeurIPS 2025