中文

重新思考文本到视觉生成中推理时提示设计

计算机视觉与模式识别 2025-12-04 v1 人工智能

摘要

在文本到视觉生成中实现用户意图与生成视觉之间的精确对齐仍是核心挑战,因为单次尝试往往无法产生所需输出。为此,先前方法主要通过扩展视觉生成过程(例如增加采样步骤或随机种子),但这会迅速导致质量平台期。此限制源于提示词——生成的关键指导因素——保持固定。为此,我们提出了推理时提示重设计框架,称为PRIS(Prompt Redesign for Inference-time Scaling),该框架会在推理过程中对提示进行自适应修订,以响应扩展后的视觉生成。PRIS的核心思想是审查生成的视觉内容,识别视觉中反复出现的失败模式,然后据此重设计提示,再用修订后的提示重新生成视觉内容。为提供精确的提示修订反馈,我们引入了一种新型验证器——元素级事实纠正——对提示属性与生成视觉之间的对齐进行粒度更细的评估,实现比整体性度量更准确且更可解释的评估。对文本到图像和文本到视频基准进行大量实验表明,我们的方法有效果,包括在VBench 2.0上实现15%的提升。这些结果表明,在推理时同步扩展提示与视觉是充分发挥推理时扩展规律的关键。可视化请访问网站:https://subin-kim-cv.github.io/PRIS。

关键词

引用

@article{arxiv.2512.03534,
  title  = {Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation},
  author = {Subin Kim and Sangwoo Mo and Mamshad Nayeem Rizve and Yiran Xu and Difan Liu and Jinwoo Shin and Tobias Hinz},
  journal= {arXiv preprint arXiv:2512.03534},
  year   = {2025}
}

备注

Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS