中文

DialogGen:面向多轮文本到图像生成的多模态交互对话系统

计算机视觉与模式识别 2025-04-21 v3

摘要

文本到图像(T2I)生成模型近年来取得了显著进展。然而,由于需要专门的提示工程知识且无法进行多轮图像生成,普通用户难以与这些模型进行有效交互,这阻碍了动态迭代的创作过程。最近的尝试试图将多模态大语言模型(MLLM)与 T2I 模型相结合,以将用户的自然语言指令转化为现实。因此,MLLM 的输出模态得到了扩展,并且得益于 MLLM 强大的多模态理解能力,T2I 模型的多轮生成质量也得到了提升。然而,随着输出模态数量的增加和对话的深入,许多此类工作在识别正确的输出模态并据此生成连贯图像方面面临挑战。因此,我们提出 DialogGen,这是一种有效的流水线,旨在对齐现成的 MLLM 和 T2I 模型,以构建用于多轮文本到图像生成的多模态交互对话系统(MIDS)。它由绘图提示对齐、精心筛选的训练数据和误差校正组成。此外,随着 MIDS 领域的蓬勃发展,迫切需要全面的基准来公平评估 MIDS 在输出模态正确性和多模态输出连贯性方面的表现。为了解决这个问题,我们引入了多模态对话基准,这是一个全面的双语基准,旨在评估 MLLM 生成支持图像编辑的准确且连贯的多模态内容的能力。它包含两个评估指标,用于衡量模型切换模态的能力和输出图像的连贯性。我们在 DialogBen 上的大量实验和用户研究证明了 DialogGen 与其他 State-of-the-Art 模型相比的有效性。

关键词

引用

@article{arxiv.2403.08857,
  title  = {DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation},
  author = {Minbin Huang and Yanxin Long and Xinchi Deng and Ruihang Chu and Jiangfeng Xiong and Xiaodan Liang and Hong Cheng and Qinglin Lu and Wei Liu},
  journal= {arXiv preprint arXiv:2403.08857},
  year   = {2025}
}

备注

Project page: https://hunyuan-dialoggen.github.io/. Accepted to NAACL2025