HICEScore:用于图像字幕评估的层次化指标
计算机视觉与模式识别
2024-07-29 v1
摘要
图像字幕评估指标可分为两大类:基于参考的指标和基于参考的指标。然而,基于参考的方法可能在评估由高级多模态大语言模型生成的包含丰富视觉细节的描述性字幕时受限于有限的人工标注参考。相比之下,基于CLIP的参考无关指标已通过跨模态相似性证明有效。然而,CLIP-based 指标受制于全局图像-文本兼容性求解,常难以检测局部文本幻觉,且对小目标不够敏感。此外,其单尺度设计无法提供诸如定位字幕错误位置和识别未被描述的视觉区域等可解释的评估过程。为此,我们提出一种新颖的图像字幕评估参考无关指标,称为层次化图像字幕评估得分(HICE-S)。通过检测局部视觉区域和文本短语,HICE-S构建了可解释的层次化评分机制,突破了现有参考无关指标的单尺度结构限制。大量实验表明,我们提出的指标在多个基准测试上实现了SOTA性能,超越了基于CLIP的指标(如CLIP-S、PAC-S)以及基于参考的指标(如METEOR、CIDEr)。此外,多个案例研究表明,HICE-S对详细字幕的评估过程接近可解释的人类判断。我们的代码已公开于 https://github.com/joeyz0z/HICE。
引用
@article{arxiv.2407.18589,
title = {HICEScore: A Hierarchical Metric for Image Captioning Evaluation},
author = {Zequn Zeng and Jianqiao Sun and Hao Zhang and Tiansheng Wen and Yudi Su and Yan Xie and Zhengjue Wang and Bo Chen},
journal= {arXiv preprint arXiv:2407.18589},
year = {2024}
}
备注
Accepted by ACM MM2024