中文

TextMatch:通过多模态优化提升图像文本一致性

计算机视觉与模式识别 2025-01-28 v3 人工智能

摘要

文本到图像生成模型在从文本创建图像方面表现优异,但在确保输出与提示之间的对齐和一致性方面存在挑战。本文引入 TextMatch,一种新型框架,利用多模态优化来解决文本到图像(T2I)生成和编辑中的图像文本偏差。TextMatch 采用由大语言模型(LLM)和视觉问答(VQA)模型驱动的评分策略,用于评估提示与生成图像之间的语义一致性。通过集成多模态情境学习和链式思考推理,本方法通过迭代优化动态细化提示,从而确保生成图像更好地捕捉用户意图,提高了保真度和相关性。广泛的实验表明,TextMatch 在多个基准测试中显著提升了文本图像一致性,建立了一个可靠的框架来推动文本到图像生成模型能力的发展。我们的代码地址为 https://anonymous.4open.science/r/TextMatch-F55C/。

关键词

引用

@article{arxiv.2412.18185,
  title  = {TextMatch: Enhancing Image-Text Consistency Through Multimodal Optimization},
  author = {Yucong Luo and Mingyue Cheng and Jie Ouyang and Xiaoyu Tao and Qi Liu},
  journal= {arXiv preprint arXiv:2412.18185},
  year   = {2025}
}

备注

Need a lot of refinements