FINEMATCH:基于方面的细粒度图文不匹配检测与纠正
计算机视觉与模式识别
2024-07-23 v2 计算与语言
摘要
大规模预训练的最新进展推动了先进视觉语言模型 的发展,使其在理解和生成多模态内容方面具有卓越能力。尽管 VLM 具有执行复杂推理的强大能力,但当前模型往往难以有效且精确地捕捉图像和文本两端的组合信息。为了解决这一问题,我们提出了 FineMatch,一种新的基于方面的细粒度文本与图像匹配基准,专注于文本与图像不匹配检测和纠正。该基准引入了一项新任务,用于提升和评估 VLM 在基于方面的细粒度文本与图像匹配上的组合性。在此任务中,模型需要识别标题内不匹配的方面短语,确定该方面的类别,并为可能包含 0 到 3 个不匹配的图文对提出纠正建议。为了评估模型在此新任务上的性能,我们提出了一种名为 ITM-IoU 的新评估指标,实验表明该指标与人类评估具有高度相关性。此外,我们还对现有的主流 VLM 进行了全面的实验分析,包括全监督学习和上下文学习 设置。我们发现,在 FineMatch 上训练的模型在检测细粒度文本与图像不匹配方面表现出更强的能力。此外,具备强大多模态上下文学习能力的模型(例如 GPT-4V、Gemini Pro Vision)在细粒度组合图文匹配分析方面并不熟练。借助 FineMatch,我们能够构建一个用于文本到图像生成幻觉检测与纠正的系统。
引用
@article{arxiv.2404.14715,
title = {FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction},
author = {Hang Hua and Jing Shi and Kushal Kafle and Simon Jenni and Daoan Zhang and John Collomosse and Scott Cohen and Jiebo Luo},
journal= {arXiv preprint arXiv:2404.14715},
year = {2024}
}
备注
ECCV 2024