一种用于图像到文本生成的新型评估框架
计算机视觉与模式识别
2024-08-06 v1 信息检索
摘要
评估自动生成图像描述的质量具有挑战性,需要能够捕捉语法性、覆盖性、正确性和真实性等各个方面的度量标准。虽然人类评估提供了宝贵的见解,但其成本和耗时的性质给局限性。现有的自动化度量标准如BLEU、ROUGE、METEOR和CIDEr旨在弥合这一差距,但常常表现出与人类判断的弱相关性。我们通过引入一个根植于现代大型语言模型(LLM)的新型评估框架,如GPT-4或Gemini,能够生成图像。在我们提出的框架中,我们首先将输入图像输入到指定的图像描述生成模型中,以生成文本描述。然后,该模型使用该描述生成一幅新的图像。通过从原始图像和LLM生成的图像中提取特征,我们使用指定的相似度度量标准来衡量它们的相似性。高相似度得分表明图像描述生成模型已准确生成了文本描述,而低相似度得分则表明存在差异,揭示了该模型潜在的不足之处。在我们的评估框架中,不需要人工标注的参考描述,这作为一种评估图像描述模型有效性的有用工具。通过人类评估,我们确认了其有效性。
引用
@article{arxiv.2408.01723,
title = {A Novel Evaluation Framework for Image2Text Generation},
author = {Jia-Hong Huang and Hongyi Zhu and Yixian Shen and Stevan Rudinac and Alessio M. Pacces and Evangelos Kanoulas},
journal= {arXiv preprint arXiv:2408.01723},
year = {2024}
}
备注
The paper has been accepted for presentation at the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval, specifically in the Large Language Model for Evaluation in IR (LLM4Eval) Workshop in 2024