中文

用于视频问答的关键词感知相对时空图网络

计算机视觉与模式识别 2023-07-26 v1

摘要

视频问答(VideoQA)的主要挑战是基于给定问题捕获并理解物体间复杂的空间与时间关系。现有的基于图的VideoQA方法通常忽略问题中的关键词,并使用简单图聚合特征而不考虑物体间的相对关系,这可能导致性能不佳。在本文中,我们提出了一种用于VideoQA的关键词感知相对时空(KRST)图网络。首先,为使问题特征感知关键词,我们在问题编码期间采用注意力机制对关键词赋予高权重。随后关键词感知的问题特征被用于引导视频图构建。其次,由于关系是相对的,我们整合相对关系建模以更好地捕获物体节点间的时空动态。此外,我们将时空推理解耦为物体级空间图与帧级时间图,从而降低了空间与时间关系推理彼此间的影响。在TGIF-QA、MSVD-QA和MSRVTT-QA数据集上的大量实验证明了我们的KRST相对于多种最先进方法的优越性。

关键词

引用

@article{arxiv.2307.13250,
  title  = {Keyword-Aware Relative Spatio-Temporal Graph Networks for Video Question Answering},
  author = {Yi Cheng and Hehe Fan and Dongyun Lin and Ying Sun and Mohan Kankanhalli and Joo-Hwee Lim},
  journal= {arXiv preprint arXiv:2307.13250},
  year   = {2023}
}

备注

under review