中文

结合模态丢弃的非分层注意力网络用于多模态对话系统中的文本回复生成

计算与语言 2021-10-22 v2

摘要

现有的基于文本和图像的多模态对话系统使用传统的分层循环编码器-解码器(HRED)框架,该框架具有一个用于建模话语表示的话语级编码器和一个用于建模上下文表示的上下文级编码器。尽管先驱性的工作展现出了有前景的性能,但它们仍然面临以下挑战:(1)文本特征和视觉特征之间的交互不够细粒度。(2)上下文表示无法为上下文提供完整的表示。为了解决上述问题,我们提出了一种结合模态丢弃的非分层注意力网络,该网络放弃了 HRED 框架,并利用注意力模块对每条话语进行编码以及建模上下文表示。为了评估我们提出的模型,我们在一个公开的多模态对话数据集上进行了全面的实验。自动评估和人工评估表明,我们提出的模型优于现有方法,并取得了 SOTA 性能。

关键词

引用

@article{arxiv.2110.09702,
  title  = {A non-hierarchical attention network with modality dropout for textual response generation in multimodal dialogue systems},
  author = {Rongyi Sun and Borun Chen and Qingyu Zhou and Yinghui Li and YunBo Cao and Hai-Tao Zheng},
  journal= {arXiv preprint arXiv:2110.09702},
  year   = {2021}
}

备注

Submitted to ICASSP2022 (currently under review)