TextMatch:通过多模态优化提升图像文本一致性
计算机视觉与模式识别
2025-01-28 v3 人工智能
摘要
文本到图像生成模型在从文本创建图像方面表现优异,但在确保输出与提示之间的对齐和一致性方面存在挑战。本文引入 TextMatch,一种新型框架,利用多模态优化来解决文本到图像(T2I)生成和编辑中的图像文本偏差。TextMatch 采用由大语言模型(LLM)和视觉问答(VQA)模型驱动的评分策略,用于评估提示与生成图像之间的语义一致性。通过集成多模态情境学习和链式思考推理,本方法通过迭代优化动态细化提示,从而确保生成图像更好地捕捉用户意图,提高了保真度和相关性。广泛的实验表明,TextMatch 在多个基准测试中显著提升了文本图像一致性,建立了一个可靠的框架来推动文本到图像生成模型能力的发展。我们的代码地址为 https://anonymous.4open.science/r/TextMatch-F55C/。
引用
@article{arxiv.2412.18185,
title = {TextMatch: Enhancing Image-Text Consistency Through Multimodal Optimization},
author = {Yucong Luo and Mingyue Cheng and Jie Ouyang and Xiaoyu Tao and Qi Liu},
journal= {arXiv preprint arXiv:2412.18185},
year = {2025}
}
备注
Need a lot of refinements