中文

Neural-Symbolic VideoQA:面向真实视频问答的组合时空推理学习

计算机视觉与模式识别 2024-04-08 v1

摘要

组合时空推理是视频问答(VideoQA)领域的重大挑战。现有方法难以建立有效的符号推理结构,这对于回答组合时空问题至关重要。为此,我们提出了一种神经符号框架,称为Neural-Symbolic VideoQA(NS-VideoQA),专为真实视频问答任务设计。NS-VideoQA 的独特性与优越性体现在两个方面:1) 提出了场景解析网络(SPN),将静态-动态视频场景转换为符号表示(SR),结构化人物、物体、关系及动作时间顺序。2) 设计了符号推理机器(SRM),进行自上而下的问题分解和自下而上的组合推理。具体而言,构建了多态程序执行器,用于从SR到最终答案进行内部一致的推理。因此,我们的NS-VideoQA不仅提升了真实VideoQA任务中的组合时空推理能力,还通过追踪中间结果实现了逐步错误分析。在AGQA Decomp 基准测试上的实验评估表明,所提出的NS-VideoQA框架有效。进一步的实证研究进一步确认,NS-VideoQA在回答组合问题时表现出内部一致性,并显著提升了VideoQA任务中时空和逻辑推理能力。

关键词

引用

@article{arxiv.2404.04007,
  title  = {Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering},
  author = {Lili Liang and Guanglu Sun and Jin Qiu and Lizhong Zhang},
  journal= {arXiv preprint arXiv:2404.04007},
  year   = {2024}
}