中文

基于 Transformer 视频表示的视听场景感知对话生成

计算与语言 2022-02-22 v1 计算机视觉与模式识别

摘要

已有许多构建多模态对话系统的尝试,这些系统能够针对给定的视听信息回答问题,此类系统的代表性任务是视听场景感知对话(AVSD)。大多数传统 AVSD 模型采用基于卷积神经网络(CNN)的视频特征提取器来理解视觉信息。虽然 CNN 倾向于获取时间和空间上的局部信息,但全局信息对于提升视频理解也至关重要,因为 AVSD 需要长期的时间视觉依赖和整体视觉信息。在本研究中,我们应用基于 Transformer 的视频特征,其比基于 CNN 的特征能更有效地捕获时间和空间上的全局表示。我们采用基于 Transformer 特征的 AVSD 模型在答案生成上获得了更高的客观性能分数。此外,我们的模型在 DSTC10 中取得了接近人类答案的主观分数。我们观察到基于 Transformer 的视觉特征有益于 AVSD 任务,因为我们的模型倾向于正确回答需要广时间和空间范围视觉信息的问题。

关键词

引用

@article{arxiv.2202.09979,
  title  = {Audio Visual Scene-Aware Dialog Generation with Transformer-based Video Representations},
  author = {Yoshihiro Yamazaki and Shota Orihashi and Ryo Masumura and Mihiro Uchida and Akihiko Takashima},
  journal= {arXiv preprint arXiv:2202.09979},
  year   = {2022}
}

备注

Accepted at DSTC10 Workshop at AAAI 2022