中文

用于视频问答的分层条件关系网络

计算机视觉与模式识别 2020-03-18 v3

摘要

视频问答(VideoQA)具有挑战性,因为它需要建模能力来提炼动态视觉产物与远距离关系,并将其与语言概念相关联。我们引入一种通用可复用神经单元,称为条件关系网络(CRN),作为构建块以构造更复杂的结构用于对视频进行表示与推理。CRN 以一组张量对象和一个条件特征为输入,并计算一组编码输出对象。模型构建变为对这些可复用单元进行复制、重排与堆叠以处理多样模态与上下文信息的简单过程。该设计因而支持高阶关系与多步推理。由此得到的 VideoQA 架构是一个 CRN 层次结构,其分支代表子视频或片段,均共享同一问题作为上下文条件。我们在知名数据集上的评测取得了新的 SOTA 结果,证明了在诸如 VideoQA 的复杂领域上构建通用推理单元的作用。

关键词

引用

@article{arxiv.2002.10698,
  title  = {Hierarchical Conditional Relation Networks for Video Question Answering},
  author = {Thao Minh Le and Vuong Le and Svetha Venkatesh and Truyen Tran},
  journal= {arXiv preprint arXiv:2002.10698},
  year   = {2020}
}

备注

Check out our code on GitHub at https://github.com/thaolmk54/hcrn-videoqa