所见即所读?改进文本-图像对齐评估
计算与语言
2023-12-27 v4 计算机视觉与模式识别
摘要
自动判定文本与对应图像是否在语义上对齐,是视觉-语言模型的一项重大挑战,在生成式文本到图像与图像到文本任务中有广泛应用。本文研究自动文本-图像对齐评估的方法。我们首先引入 SeeTRUE:一个综合评估集,涵盖来自文本到图像与图像到文本生成任务的多个数据集,并带有关于给定文本-图像对是否语义对齐的人类判断。随后我们描述两种判定对齐的自动方法:第一种是基于问题生成与视觉问答模型的流水线,第二种是通过微调多模态预训练模型采用的端到端分类方法。两种方法在各种文本-图像对齐任务中均超越先前方法,在涉及复杂组合或不自然图像的挑战性案例中提升显著。最后,我们展示了我们的方法如何定位图像与给定文本之间的具体不对齐,以及如何用于自动重排序文本到图像生成中的候选结果。
引用
@article{arxiv.2305.10400,
title = {What You See is What You Read? Improving Text-Image Alignment Evaluation},
author = {Michal Yarom and Yonatan Bitton and Soravit Changpinyo and Roee Aharoni and Jonathan Herzig and Oran Lang and Eran Ofek and Idan Szpektor},
journal= {arXiv preprint arXiv:2305.10400},
year = {2023}
}
备注
Accepted to NeurIPS 2023. Website: https://wysiwyr-itm.github.io/