通过排序与基于 LLM 的融合提升图像描述丰富性
计算机视觉与模式识别
2025-10-28 v3 人工智能
计算与语言
数据库
机器学习
摘要
当前最优(SoTA)图像描述模型通常在 MicroSoft Common Objects in Context (MS-COCO) 数据集上训练,该数据集包含人工标注的描述,平均长度约为十个词元。尽管对通用场景理解有效,这些短描述往往无法刻画复杂场景并传达详细信息。此外,描述模型往往表现出朝向“平均”描述的偏置,其仅捕捉更通用的方面,从而忽略更精细的细节。本文中,我们提出一种通过组合不同 SoTA 描述模型所生成的描述来产生更丰富且更具信息量的图像描述的新方法。我们提出的方法无需额外模型训练:给定一幅图像,它利用文献中的预训练模型生成初始描述,然后使用我们新引入的基于图像-文本的度量(命名为 BLIPScore)对它们排序。随后,使用前两个描述通过大语言模型(LLM)融合以产生最终的、更详细的描述。在 MS-COCO 和 Flickr30k 测试集上的实验结果表明,根据 ALOHa、CAPTURE 和 Polos 度量,我们的方法在描述-图像对齐和减少幻觉方面有效。一项主观研究进一步支持这些结果,表明我们的模型生成的描述通常被认为更符合人类判断。通过结合多样 SoTA 模型的优势,我们的方法提升了图像描述的质量与吸引力,弥合了自动化系统与人类生成描述丰富信息性之间的差距。这一进展使得能够为视觉-语言模型和描述模型的训练生成更合适的描述。
引用
@article{arxiv.2306.11593,
title = {Improving Image Captioning Descriptiveness by Ranking and LLM-based Fusion},
author = {Luigi Celona and Simone Bianco and Marco Donzella and Paolo Napoletano},
journal= {arXiv preprint arXiv:2306.11593},
year = {2025}
}
备注
This manuscript has been accepted for publication in Springer Neural Computing and Applications