中文

先定位后回答:面向视频问答的答案引导问题定位

计算机视觉与模式识别 2023-10-13 v2

摘要

视频问答(VideoQA)是视觉-语言理解中的一项基本任务,近期吸引了大量研究关注。然而,现有工作大多在时长 15 秒以内的短视频上取得良好表现。对于分钟级长视频上的 VideoQA,这些方法可能因缺乏处理由场景变换与视频中多动作引发的噪声与冗余的能力而失效。考虑到问题常集中于较短的时间区间,我们提出先将问题定位至视频中的某一段,再仅利用该定位片段推断答案。在此框架下,我们提出“先定位后回答”(LocAns),一种将问题定位器与答案预测器整合至端到端模型的新方法。训练阶段中,可用的答案标签既作为答案预测器的监督信号,也用于为问题定位器生成伪时间标签。此外,我们设计了解耦交替训练策略以分别更新两个模块。实验中,LocAns 在两个现代长视频问答数据集 NExT-QA 与 ActivityNet-QA 上取得了最先进性能,且其定性示例展示了问题定位的可靠表现。

关键词

引用

@article{arxiv.2210.02081,
  title  = {Locate before Answering: Answer Guided Question Localization for Video Question Answering},
  author = {Tianwen Qian and Ran Cui and Jingjing Chen and Pai Peng and Xiaowei Guo and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2210.02081},
  year   = {2023}
}