中文

DiffChat:学习与文本到图像合成模型对话以实现交互式图像创作

计算与语言 2024-03-11 v1 计算机视觉与模式识别

摘要

我们提出了 DiffChat,这是一种将大型语言模型(LLMs)与以提示为输入的文本到图像合成(TIS)模型(例如 Stable Diffusion)进行“对话”对齐的新方法,用于交互式图像创作。给定原始提示/图像和用户指定的指令,DiffChat 可以有效地进行适当的修改并生成目标提示,进而可用于创建高质量的目标图像。为实现这一目标,我们首先收集了一个名为 InstructPE 的遵循指令的提示工程数据集,用于 DiffChat 的有监督训练。接下来,我们提出了一个强化学习框架,利用图像创作的三个核心标准(即美学、用户偏好和内容完整性)作为反馈。该框架涉及动作空间动态修改技术,以便在非策略采样期间获得更相关的正样本和更难负样本。内容完整性也被引入价值估计函数,以进一步改进生成的图像。基于自动评估和人工评估,我们的方法表现出优于基线模型和强大竞争对手的性能,充分证明了其有效性。

关键词

引用

@article{arxiv.2403.04997,
  title  = {DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation},
  author = {Jiapeng Wang and Chengyu Wang and Tingfeng Cao and Jun Huang and Lianwen Jin},
  journal= {arXiv preprint arXiv:2403.04997},
  year   = {2024}
}