文本远远不够:将视觉印象融入开放域对话生成
计算与语言
2021-09-21 v2
摘要
自然语言处理(NLP)中的开放域对话生成默认是一项纯语言任务,旨在通过生成相关且信息丰富的回复来满足人类对开放话题日常交流的需求。在本文中,我们指出可以从纯文本数据中挖掘出隐藏的图像,称为视觉印象(VIs),以增强对话理解并帮助生成更好的回复。此外,对话帖子与其回复之间的语义依赖关系十分复杂,例如词对齐少以及一些话题转换。因此,二者的视觉印象并不共享,将回复视觉印象(RVIs)而非帖子视觉印象(PVIs)整合进解码器更为合理。然而,在测试过程中回复及其RVIs并不直接给出。为处理上述问题,我们提出了一种框架,基于纯语言对话数据集显式构建VIs,并利用它们实现更好的对话理解与生成。具体而言,我们基于预训练的词-图像映射模型为每条帖子获取一组图像(PVIs)。这些PVIs在协同注意力编码器中用于得到兼具视觉与文本信息的帖子表示。由于测试时RVIs不直接提供,我们设计了一个由两个子解码器组成的级联解码器。第一个子解码器预测回复中的内容词,并应用词-图像映射模型得到那些RVIs。随后,第二个子解码器基于帖子和RVIs生成回复。在两个开放域对话数据集上的实验结果表明,我们提出的方法优于具有竞争力的基线模型。
引用
@article{arxiv.2109.05778,
title = {Text is NOT Enough: Integrating Visual Impressions into Open-domain Dialogue Generation},
author = {Lei Shen and Haolan Zhan and Xin Shen and Yonghao Song and Xiaofang Zhao},
journal= {arXiv preprint arXiv:2109.05778},
year = {2021}
}
备注
Accepted by ACM MultiMedia 2021