中文

DSTC8-AVSD:具有检索式词生成器的多模态语义 Transformer 网络

计算与语言 2020-04-20 v1 机器学习

摘要

音视觉场景感知对话(AVSD)是在给定场景、视频、音频以及对话历史的前提下,针对问题生成回复的任务。该任务的现有系统采用基于 transformer 或循环神经网络的编码器-解码器框架架构。尽管这些技术在该任务上表现出优越性能,但它们存在显著局限:模型容易过拟合而仅记忆语法模式;模型遵循数据集中词汇的先验分布。为缓解这些问题,我们提出多模态语义 Transformer 网络。它采用基于 transformer 的架构,并带有基于注意力的词嵌入层,通过查询词嵌入来生成词。借助该设计,我们的模型在生成阶段持续考虑词的含义。实证结果证明了我们所提模型的优越性,其性能优于大多数先前针对 AVSD 任务的工作。

关键词

引用

@article{arxiv.2004.08299,
  title  = {DSTC8-AVSD: Multimodal Semantic Transformer Network with Retrieval Style Word Generator},
  author = {Hwanhee Lee and Seunghyun Yoon and Franck Dernoncourt and Doo Soon Kim and Trung Bui and Kyomin Jung},
  journal= {arXiv preprint arXiv:2004.08299},
  year   = {2020}
}

备注

Presented at DSTC Workshop @ AAAI 2020