面向文本到图像扩散模型的奖励无关提示优化
机器学习
2025-09-30 v2
摘要
我们研究了一种改进用户提示词的通用方法,用于文本到图像 (T2I) 扩散模型,通过寻找最大化测试时指定的奖励函数的提示词。尽管多种奖励模型用于评估图像生成,但现有的自动化提示工程方法通常针对特定的奖励配置进行设计。因此,这些专业化的设计在应用于新的提示工程场景(涉及不同的奖励模型)时表现次佳。为此,我们引入RATTPO (Reward-Agnostic Test-Time Prompt Optimization),这是一种无需修改即可适用于各种奖励情境的灵活测试时优化方法。RATTPO通过查询大型语言模型 (LLM)而无需奖励特定任务描述,迭代搜索优化后的提示词。它使用优化轨迹和新颖的奖励感知反馈信号(称为"提示")作为上下文。经验结果表明,RATTPO在各种奖励设置下均能有效提升用户提示词,这些设置评估各种生成方面,如美学、通用人类偏好或对象之间的空间关系。RATTPO在搜索效率方面优于其他测试时搜索基线,平均快4.8倍。此外,在充足的推理预算下,RATTPO可以实现与需要奖励特定微调的学习型基线相当的性能。代码已公开于https://github.com/seminkim/RATTPO。
引用
@article{arxiv.2506.16853,
title = {Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models},
author = {Semin Kim and Yeonwoo Cha and Jaehoon Yoo and Seunghoon Hong},
journal= {arXiv preprint arXiv:2506.16853},
year = {2025}
}
备注
29 pages, Under review