中文

面向文本到图像模型的测试时提示优化

机器学习 2025-07-31 v1

摘要

文本到图像(T2I)生成模型取得了显著进展,但仍在提示敏感性方面存在挑战:即使对提示文字进行微小更改,也可能导致输出不一致或不准确。为此,我们引入一种闭环、测试时提示优化框架,无需对底层 T2I 模型进行额外训练,称为 TIR。在我们的方法中,每一步生成后跟随一个优化步骤,预训练的多模态大语言模型(MLLM)分析输出图像和用户提示。MLLM 检测误差(例如缺失对象、错误属性),并为下一轮图像生成生成一个经过优化且符合物理规律的提示。通过迭代优化提示并验证提示与图像之间的对齐,TIR 纠正了错误,类似于人类艺术家的迭代细化过程。我们在多个基准数据集上演示,该闭环策略在保持与黑盒 T2I 模型即插即用集成的同时,提高了对齐性和视觉一致性。

关键词

引用

@article{arxiv.2507.22076,
  title  = {Test-time Prompt Refinement for Text-to-Image Models},
  author = {Mohammad Abdul Hafeez Khan and Yash Jain and Siddhartha Bhattacharyya and Vibhav Vineet},
  journal= {arXiv preprint arXiv:2507.22076},
  year   = {2025}
}

备注

Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables