VELA:一种用于评估长图像标题的 LLM-混合作为裁判方法
计算机视觉与模式识别
2025-10-01 v1 人工智能
计算与语言
摘要
在本研究中,我们关注对由多模态大语言模型生成的长且详细的图像标题的自动评估。现有的大多数图像标题自动评估指标主要针对短标题设计,不适用于评估长标题。此外,近期的 LLM-as-a-Judge 方法由于依赖自回归推理和视觉信息的早期融合,存在推理速度慢的问题。为了解决这些局限性,我们提出了 VELA,一种在新型 LLM-Hybrid-as-a-Judge 框架内开发的长标题自动评估指标。此外,我们提出了 LongCap-Arena,一个专门为评估长标题指标而设计的基准。该基准包含 7,805 张图像、对应的人工提供的长参考标题和长候选标题,以及来自三个不同视角的 32,246 条人工判断:描述性、相关性和流畅性。我们证明 VELA 优于现有指标,并在 LongCap-Arena 上实现了超越人类的性能。
引用
@article{arxiv.2509.25818,
title = {VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions},
author = {Kazuki Matsuda and Yuiga Wada and Shinnosuke Hirano and Seitaro Otsuki and Komei Sugiura},
journal= {arXiv preprint arXiv:2509.25818},
year = {2025}
}
备注
EMNLP 2025 Main Conference