中文

TIFA:基于问答的准确且可解释的文本到图像忠实度评估

计算机视觉与模式识别 2023-08-21 v3

摘要

尽管有数千名研究人员、工程师和艺术家积极致力于改进文本到图像生成模型,系统仍经常无法生成与文本输入准确对齐的图像。我们提出 TIFA(Text-to-Image Faithfulness evaluation with question Answering,基于问答的文本到图像忠实度评估),一种通过视觉问答(VQA)来衡量生成图像对其文本输入忠实度的自动评估指标。具体而言,给定文本输入,我们使用语言模型自动生成若干问答对。我们通过检查现有 VQA 模型能否利用生成图像回答这些问题来计算图像忠实度。TIFA 是一种无参考指标,允许对生成图像进行细粒度且可解释的评估。TIFA 也与人类判断具有比现有指标更好的相关性。基于该方法,我们推出 TIFA v1.0,一个由 12 个类别(物体、计数等)中 4K 多样化文本输入和 25K 问题组成的基准。我们使用 TIFA v1.0 对现有文本到图像模型进行全面评估,并凸显当前模型的局限性与挑战。例如,我们发现当前文本到图像模型尽管在颜色和材质上表现良好,仍在计数、空间关系和组合多个物体方面存在困难。我们希望我们的基准能帮助仔细衡量文本到图像合成的研究进展,并为进一步研究提供有价值的见解。

关键词

引用

@article{arxiv.2303.11897,
  title  = {TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering},
  author = {Yushi Hu and Benlin Liu and Jungo Kasai and Yizhong Wang and Mari Ostendorf and Ranjay Krishna and Noah A Smith},
  journal= {arXiv preprint arXiv:2303.11897},
  year   = {2023}
}

备注

Accepted to ICCV 2023