中文

关注所需:用于视频问答的运动—表观协同网络

计算机视觉与模式识别 2021-06-22 v1 人工智能

摘要

视频问答是一项要求 AI 智能体基于视频回答问题的任务。该任务带来三个关键挑战:(1) 理解各类问题的意图,(2) 捕捉输入视频的各种要素(如物体、动作、因果关系),以及 (3) 语言与视觉信息之间的跨模态对齐。我们提出了运动—表观协同网络(MASN),其嵌入基于运动与表观信息的两种跨模态特征,并根据问题意图有选择地利用它们。MASN 由一个运动模块、一个表观模块以及一个运动—表观融合模块组成。运动模块计算面向动作的交叉模态联合表示,而表观模块聚焦于输入视频的表观方面。最后,运动—表观融合模块以运动模块与表观模块各自的输出为输入,执行问题引导的融合。结果表明,MASN 在 TGIF-QA 与 MSVD-QA 数据集上取得了新的 SOTA 性能。我们还通过可视化 MASN 的推理结果进行了定性分析。代码见 https://github.com/ahjeongseo/MASN-pytorch。

关键词

引用

@article{arxiv.2106.10446,
  title  = {Attend What You Need: Motion-Appearance Synergistic Networks for Video Question Answering},
  author = {Ahjeong Seo and Gi-Cheon Kang and Joonhan Park and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:2106.10446},
  year   = {2021}
}

备注

ACL 2021