中文

VGNMN:面向视频 grounding 语言任务的视频 grounding 神经模块网络

计算机视觉与模式识别 2022-06-14 v2 人工智能 计算与语言 机器学习

摘要

神经模块网络(NMN)已在图像 grounding 任务(如合成图像上的视觉问答(VQA))中取得成功。然而,关于 NMN 在视频 grounding 对话任务中的研究非常有限。这些任务由于额外的视觉时间变化和语言跨轮次依赖,扩展了传统视觉任务的复杂性。受近期图像 grounding 任务上 NMN 方法的启发,我们引入视频 grounding 神经模块网络(VGNMN),将视频 grounding 语言任务中的信息检索过程建模为神经模块的流水线。VGNMN 首先分解对话中的所有语言成分,以显式解决任何实体指代并从问题中检测相应的基于动作的输入。检测到的实体和动作被用作参数来实例化神经模块网络并从视频中提取视觉线索。我们的实验表明,VGNMN 在一个具有挑战性的视频 grounding 对话基准以及一个视频 QA 基准上均能取得有前景的性能。

关键词

引用

@article{arxiv.2104.07921,
  title  = {VGNMN: Video-grounded Neural Module Network to Video-Grounded Language Tasks},
  author = {Hung Le and Nancy F. Chen and Steven C. H. Hoi},
  journal= {arXiv preprint arXiv:2104.07921},
  year   = {2022}
}

备注

Accepted at NAACL 2022 (Oral)