FuseCap:利用大语言模型生成增强的融合图像描述
计算机视觉与模式识别
2023-11-17 v2 人工智能
计算与语言
摘要
视觉-语言预训练技术的出现极大地推动了图像描述模型的发展。然而,这些模型经常生成通用描述,并可能遗漏语义重要的图像细节。这一局限可追溯到图像-文本数据集:其描述通常提供图像内容的概括性说明,却常遗漏显著细节。考虑到这些数据集的规模,人工重新标注不切实际,凸显了对自动化方法的需求。为应对这一挑战,我们利用现有描述,并借助“冻结”视觉专家(包括目标检测器、属性识别器和光学字符识别器(OCR))以视觉细节扩充描述。我们提出的方法 FuseCap 使用大语言模型(LLM)将此类视觉专家的输出与原始描述相融合,生成全面的图像描述。我们自动构建了包含 1200 万图像-增强描述对的训练集。这些描述对通过定量与定性分析进行了广泛评估。随后,该数据被用于训练基于 BLIP 的描述生成模型。该模型优于当前最先进的方法,生成更精确且详尽的描述,证明了所提以数据为中心方法的有效性。我们向社区发布这一大规模增强图像-描述对数据集。
引用
@article{arxiv.2305.17718,
title = {FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions},
author = {Noam Rotstein and David Bensaid and Shaked Brody and Roy Ganz and Ron Kimmel},
journal= {arXiv preprint arXiv:2305.17718},
year = {2023}
}