中文

STAIR:面向视频问答的具有可审计中间结果的时空推理模型

计算机视觉与模式识别 2024-01-09 v1 计算与语言

摘要

近年来,我们见证了视频问答模型的快速发展。然而,大多数模型只能处理时序推理方面简单的视频,在回答长且信息丰富的视频上的时序推理问题时,其性能往往会下降。为解决这一问题,我们提出了 STAIR,一个面向视频问答的具有可审计中间结果的时空推理模型。STAIR 是一个神经模块网络,包含一个程序生成器,用于将给定问题分解为若干子任务的层次化组合,以及一组轻量级神经模块,用于完成每个子任务。尽管神经模块网络在图像-文本任务上已被广泛研究,但将其应用于视频并非易事,因为视频推理需要不同的能力。在本文中,我们为视频问答定义了一组基本的视频-文本子任务,并设计了一组轻量级模块来完成它们。与大多数先前工作不同,STAIR 的模块返回特定于其意图的中间输出,而非总是返回注意力图,这使得其更易于解释并与预训练模型协作。我们还引入了中间监督,以使这些中间输出更加准确。我们在多个视频问答数据集上进行了广泛实验,展示了 STAIR 在各种设置下的性能、可解释性、与预训练模型的兼容性,以及在程序标注不可用时的适用性。代码:https://github.com/yellow-binary-tree/STAIR

关键词

引用

@article{arxiv.2401.03901,
  title  = {STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering},
  author = {Yueqian Wang and Yuxuan Wang and Kai Chen and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2401.03901},
  year   = {2024}
}

备注

To appear in AAAI 2024