发现视频问答的时空理据
计算机视觉与模式识别
2023-07-25 v1
摘要
本文致力于解决复杂视频问答(VideoQA)问题,其特征是包含多个物体与不同时刻事件的较长视频。为应对该挑战,我们强调了从海量视频内容中识别问题关键时间片段与空间物体的重要性。为此,我们提出时空理据化(STR),一种利用跨模态交互自适应收集问题关键片段与物体的可微分选择模块。所发现的视频片段与物体随后作为接地理据以支持答案推理。基于 STR,我们进一步提出 TranSTR,一种以 STR 为核心并额外强调新颖答案交互机制以协同 STR 进行答案解码的 Transformer 风格神经网络架构。在四个数据集上的实验表明 TranSTR 取得了新的最先进(SoTA)性能。尤其在以复杂 VideoQA 为特征的 NExT-QA 与 Causal-VidQA 上,它分别显著超越先前 SoTA 达 5.8% 与 6.8%。我们随后开展广泛研究以验证 STR 及所提答案交互机制的重要性。凭借 TranSTR 的成功与我们的全面分析,希望本工作能激发未来在复杂 VideoQA 上的更多努力。代码将发布于 https://github.com/yl3800/TranSTR。
引用
@article{arxiv.2307.12058,
title = {Discovering Spatio-Temporal Rationales for Video Question Answering},
author = {Yicong Li and Junbin Xiao and Chun Feng and Xiang Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2307.12058},
year = {2023}
}
备注
Accepted to ICCV2023