中文

面向视频 grounded 对话的结构化共指图注意力

计算机视觉与模式识别 2021-03-25 v1

摘要

本文提出了一种称为结构化共指图注意力(SCGA)的视频 grounded 对话系统,用于在给定视频相关问题上解码答案序列,同时跟踪对话上下文。尽管近期研究在提升回复质量方面取得了重大进展,但性能仍远未令人满意。两个主要挑战如下:(1)如何推导多模态间的共指关系;(2)如何对具有复杂时空动态的丰富底层视频语义结构进行推理。为此,SCGA 基于(1)结构化共指解析器,通过构建多模态上的结构化图来执行去指称;(2)时空视频推理器,通过渐进邻域图注意力捕获视频的局部到全局动态。SCGA 利用指针网络动态复制问题的一部分以解码答案序列。所提 SCGA 的有效性在 AVSD@DSTC7 和 AVSD@DSTC8 数据集(具有挑战性的视频 grounded 对话基准)以及 TVQA 数据集(大规模视频问答基准)上得到验证。我们的实证结果表明,SCGA 在两个基准上均优于其他最先进的对话系统,而广泛的消融研究和定性分析揭示了性能提升与改进的可解释性。

关键词

引用

@article{arxiv.2103.13361,
  title  = {Structured Co-reference Graph Attention for Video-grounded Dialogue},
  author = {Junyeong Kim and Sunjae Yoon and Dahyun Kim and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2103.13361},
  year   = {2021}
}

备注

Accepted to AAAI2021