分解、评估与精炼:利用迭代 VQA 反馈评估并改进文生图对齐
计算机视觉与模式识别
2023-12-07 v2 人工智能
机器学习
多媒体
机器学习
摘要
随着潜在扩散模型近期的出现,文本条件图像生成领域取得了空前的进展。尽管如此,当给定文本输入的复杂度增加时,最先进的扩散模型仍可能无法生成准确传达给定提示语义的图像。此外,已观察到此类不对齐往往未被 CLIP 等预训练多模态模型检测到。为解决这些问题,本文探索了一种简单而有效的分解式方法,用于文生图对齐的评估与改进。具体而言,我们首先引入一个分解对齐分数(Decompositional-Alignment-Score),其对给定复杂提示将其分解为一组互不相交的断言。随后使用 VQA 模型度量每个断言与生成图像的对齐程度。最后,将不同断言的对齐分数后验地结合给出最终的文生图对齐分数。实验分析表明,相较于传统 CLIP、BLIP 分数,所提对齐指标与人类评分的相关性显著更高。此外,我们还发现断言级对齐分数提供了一种有用的反馈,可用于一个简单的迭代过程,逐步增强最终图像输出中不同断言的表达。人类用户研究表明,所提方法在整体文生图对齐准确率上超越先前 SOTA 达 8.7%。我们的项目页面位于 https://1jsingh.github.io/divide-evaluate-and-refine
引用
@article{arxiv.2307.04749,
title = {Divide, Evaluate, and Refine: Evaluating and Improving Text-to-Image Alignment with Iterative VQA Feedback},
author = {Jaskirat Singh and Liang Zheng},
journal= {arXiv preprint arXiv:2307.04749},
year = {2023}
}