中文

基于潜在图像的开放域对话生成

计算与语言 2021-06-02 v2 人工智能 计算机视觉与模式识别

摘要

我们考虑用图像来支撑开放域对话。现有工作假设图像和文本上下文都可用,但图像支撑的对话本质上比文本对话更难获取。因此,我们提出通过同时利用图像支撑对话和文本对话来学习回复生成模型,其假设是会话发生时的视觉场景信息可由一幅图像表示,并试图通过文本到图像生成技术来恢复文本对话的潜在图像。这两类对话的似然由一个回复生成器和一个图像重建器来表述,二者在条件变分自编码框架内学习。我们在图像支撑对话和基于文本的对话两种场景下进行了实证研究。在第一种场景(图像支撑对话)中,尤其是低资源设置下,带有潜在图像的文本对话可有效扩充图像支撑对话数据;而在第二种场景中,潜在图像能够丰富回复内容,同时使其与上下文保持相关。

关键词

引用

@article{arxiv.2004.01981,
  title  = {Open Domain Dialogue Generation with Latent Images},
  author = {Ze Yang and Wei Wu and Huang Hu and Can Xu and Wei Wang and Zhoujun Li},
  journal= {arXiv preprint arXiv:2004.01981},
  year   = {2021}
}

备注

AAAI2021