DiffChat:学习与文本到图像合成模型对话以实现交互式图像创作
计算与语言
2024-03-11 v1 计算机视觉与模式识别
摘要
我们提出了 DiffChat,这是一种将大型语言模型(LLMs)与以提示为输入的文本到图像合成(TIS)模型(例如 Stable Diffusion)进行“对话”对齐的新方法,用于交互式图像创作。给定原始提示/图像和用户指定的指令,DiffChat 可以有效地进行适当的修改并生成目标提示,进而可用于创建高质量的目标图像。为实现这一目标,我们首先收集了一个名为 InstructPE 的遵循指令的提示工程数据集,用于 DiffChat 的有监督训练。接下来,我们提出了一个强化学习框架,利用图像创作的三个核心标准(即美学、用户偏好和内容完整性)作为反馈。该框架涉及动作空间动态修改技术,以便在非策略采样期间获得更相关的正样本和更难负样本。内容完整性也被引入价值估计函数,以进一步改进生成的图像。基于自动评估和人工评估,我们的方法表现出优于基线模型和强大竞争对手的性能,充分证明了其有效性。
引用
@article{arxiv.2403.04997,
title = {DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation},
author = {Jiapeng Wang and Chengyu Wang and Tingfeng Cao and Jun Huang and Lianwen Jin},
journal= {arXiv preprint arXiv:2403.04997},
year = {2024}
}