视觉事实检查器:启用高保真细粒度描述生成
计算机视觉与模式识别
2024-05-01 v1
摘要
现有自动视觉内容描述方法面临诸多挑战,如细节不足、内容幻觉以及指令遵循不佳。本文提出了VisualFactChecker (VFC),一个灵活的无训练管道,可为2D图像和3D物体生成高保真且细节丰富的描述。VFC包含三个步骤:1) 提案阶段,图像到文本描述模型提出多个初始描述;2) 验证阶段,大语言模型(LLM)利用目标检测和VQA模型对提议的描述进行事实核查;3) 描述生成阶段,LLM综合描述提案和事实核查结果生成最终描述。在该步骤中,VFC可灵活地按照复杂指令生成各种风格的描述。我们使用四个评估指标进行全面描述评估:1) CLIP-Score衡量图像-文本相似度;2) CLIP-Image-Score衡量原始图像与使用描述生成的文本到图像模型重构图像之间的图像-图像相似度;3) Amazon Mechanical Turk上的人类研究;4) GPT-4V进行细粒度评估。评估结果表明,VFC在COCO数据集上的2D图像描述以及Objaverse数据集上的3D资产描述方面,优于现有SOTA开源描述方法。我们的研究表明,尽管模型规模仅为专有模型(如GPT-4V)的1/10,仅通过将开源模型组合构建管道,即可实现相当于专有模型的描述生成能力。
引用
@article{arxiv.2404.19752,
title = {Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation},
author = {Yunhao Ge and Xiaohui Zeng and Jacob Samuel Huffman and Tsung-Yi Lin and Ming-Yu Liu and Yin Cui},
journal= {arXiv preprint arXiv:2404.19752},
year = {2024}
}
备注
CVPR 2024