偏好自适应与顺序文本到图像生成
计算机视觉与模式识别
2025-05-29 v2 人工智能
计算与语言
机器学习
系统与控制
系统与控制
摘要
我们解决的是交互式文本到图像(T2I)生成的问题,设计了一个强化学习(RL)代理,通过一系列提示扩展逐步改进一组为用户生成的图像。我们利用人类评分者创建了一个新的顺序偏好数据集,并将其与大规模开源(非顺序)数据集结合使用。我们采用EM策略构建用户偏好和用户选择模型,识别出不同的用户偏好类型。随后我们利用大型多模态语言模型(LMM)和基于价值的RL方法,为用户提供自适应且多样化的提示扩展建议。我们的偏好自适应顺序文本到图像代理(PASTA)将自适应的多轮能力扩展到T2I模型中,促进了协作式创作,并解决了用户意图中的不确定性或不完整性。我们通过人类评分者对PASTA进行评估,显示出与基线方法相比具有显著的改进。我们也开源了我们的顺序评分数据集和模拟的用户-评分互动,以支持面向用户中心多轮T2I系统的未来研究。
引用
@article{arxiv.2412.10419,
title = {Preference Adaptive and Sequential Text-to-Image Generation},
author = {Ofir Nabati and Guy Tennenholtz and ChihWei Hsu and Moonkyung Ryu and Deepak Ramachandran and Yinlam Chow and Xiang Li and Craig Boutilier},
journal= {arXiv preprint arXiv:2412.10419},
year = {2025}
}
备注
Accepted to ICML 2025 Link to PASTA dataset: https://www.kaggle.com/datasets/googleai/pasta-data