教文本到图像模型在对话中进行交流
计算与语言
2024-02-09 v2 人工智能
计算机视觉与模式识别
摘要
一图胜千言,因此,对话智能体理解、感知并有效地以图片回应至关重要。然而,我们发现直接采用常规图像生成技术不足以让对话智能体有效生成图像回应。本文聚焦于创新的对话到图像生成任务,即模型合成一张与给定对话上下文对齐的高分辨率图像作为回应。为解决该问题,我们在最先进的文本到图像生成模型之上设计了定制化的微调方法,以在图像生成过程中充分利用对话上下文的结构与语义特征。具体而言,我们用特定指示符将对话上下文线性化以保持对话结构,并采用领域内数据缓解对话到图像与常规图像生成任务之间的风格不匹配。在 PhotoChat 与 MMDialog 语料上的实证结果表明,我们的方法在 3 种最先进的预训练文本到图像生成骨干网络上带来了持续且显著的提升。
引用
@article{arxiv.2309.15516,
title = {Teaching Text-to-Image Models to Communicate in Dialog},
author = {Xiaowen Sun and Jiazhan Feng and Yuxuan Wang and Yuxuan Lai and Xingyu Shen and Dongyan Zhao},
journal= {arXiv preprint arXiv:2309.15516},
year = {2024}
}
备注
Work in progress