中文

一种更优的注意力方式:基于树的视频问答注意力机制

计算机视觉与模式识别 2019-09-15 v1 计算与语言 机器学习

摘要

我们提出一种用于视频问答的新型注意力模型。注意力模型的主要思想是定位视觉数据中最具信息量的部分。注意力机制当下颇为流行。然而,多数现有视觉注意力机制将问题视为整体,忽略了词级语义——每个词可具有不同注意力且某些词无需注意力,也未考虑句子的语义结构。尽管视频问答的扩展软注意力(E-SA)模型利用了词级注意力,其在长问句上表现不佳。本文提出异构树结构记忆网络(HTreeMN)用于视频问答。我们所提方法基于问句的句法解析树。HTreeMN 区别对待词语,其中 \textit{视觉} 词经注意力模块处理,而 \textit{言语} 词则不。它还利用句子的语义结构,基于解析树的递归结构合并相邻节点。对词与视频的理解从叶节点向根节点传播与融合。此外,我们构建层次化注意力机制以提炼所关注特征。我们在两个数据集上评估该方法。实验结果表明,我们的 HTreeMN 模型优于其他注意力模型,尤其在复杂问题上。我们的代码已在 github 发布。代码见 https://github.com/ZJULearning/TreeAttention

关键词

引用

@article{arxiv.1909.02218,
  title  = {A Better Way to Attend: Attention with Trees for Video Question Answering},
  author = {Hongyang Xue and Wenqing Chu and Zhou Zhao and Deng Cai},
  journal= {arXiv preprint arXiv:1909.02218},
  year   = {2019}
}

备注

12 pages