面向参考灵活场景的无 LLM 图像描述评估
计算机视觉与模式识别
2025-12-29 v1
摘要
我们聚焦于图像描述的自动评估,涵盖参考基准和参考自由两种场景。现有基于大语言模型(LLM)的指标因偏好其自身生成而质疑中立性。大多数无 LLM 指标不受此问题影响,但表现不始终如一。为此,我们提出 Pearl,这是一种无 LLM 的监督式指标,可用于参考基准和参考自由场景。我们引入一种新机制,学习图像-描述和描述-描述的相似性表征。此外,我们构建了一个人工标注的数据集用于图像描述评估,包含约 33 万人类判断,来自 2360 名标注者,覆盖超过 7.5 万张图片。Pearl 在 Composite、Flickr8K-Expert、Flickr8K-CF、Nebula 和 FOIL 数据集上优于其他现有无 LLM 指标,适用于参考基准和参考自由场景。我们的项目页面地址为 https://pearl.kinsta.page/。
引用
@article{arxiv.2512.21582,
title = {LLM-Free Image Captioning Evaluation in Reference-Flexible Settings},
author = {Shinnosuke Hirano and Yuiga Wada and Kazuki Matsuda and Seitaro Otsuki and Komei Sugiura},
journal= {arXiv preprint arXiv:2512.21582},
year = {2025}
}
备注
Accepted for presentation at AAAI2026