中文

照片分享多模态对话生成的端到端模型

计算与语言 2025-04-01 v2

摘要

照片分享多模态对话生成要求对话代理不仅生成文本回复,还要在适当的时刻分享照片。以图像文本描述作为桥梁,流水线模型整合了图像描述模型、文本生成模型和图像生成模型来处理这一复杂的多模态任务。然而,以文本描述表示图像可能会丢失重要的视觉细节和信息,并在复杂的对话系统中导致误差传播。此外,流水线模型将三个模型彼此隔离,因为离散的图像文本描述阻碍了端到端梯度传播。我们提出了首个照片分享多模态对话生成的端到端模型,它将图像感知器与图像生成器与大语言模型集成。大语言模型在输入端采用Q-Former来感知视觉图像。在输出端进行图像生成时,我们提出了一种动态词汇变换矩阵,并使用直通和gumbel-softmax技术来对齐大语言模型与Stable Diffusion模型,从而实现端到端梯度传播。我们在PhotoChat和DialogCC数据集上进行了实验以评估我们的端到端模型。与流水线模型相比,端到端模型在文本和图像生成的各项指标上取得了最先进性能。更多的分析实验也验证了端到端模型在照片分享多模态对话生成中的有效性。

关键词

引用

@article{arxiv.2408.08650,
  title  = {An End-to-End Model for Photo-Sharing Multi-modal Dialogue Generation},
  author = {Peiming Guo and Sinuo Liu and Yanzhao Zhang and Dingkun Long and Pengjun Xie and Meishan Zhang and Min Zhang},
  journal= {arXiv preprint arXiv:2408.08650},
  year   = {2025}
}

备注

Accepted by ICME2025