中文

扫视与聚焦:面向多事件视频问答的记忆提示

计算机视觉与模式识别 2024-01-04 v1

摘要

视频问答(VideoQA)已成为评估智能体理解人类日常行为能力的重要工具。尽管大型视觉语言模型在许多多模态任务中最近取得了成功,但涉及多个人-物交互事件的复杂视频情境推理仍然具有挑战性。相比之下,人类可以通过使用一系列情节记忆作为锚点,快速定位与问题相关的关键时刻进行推理,从而轻松应对。为了模仿这种有效的推理策略,我们提出了扫视-聚焦模型。一种简单的方法是应用动作检测模型来预测一组动作作为关键记忆。然而,这些封闭集词汇内的动作难以泛化到各种视频领域。取而代之,我们训练一个编码器-解码器在扫视阶段生成一组动态事件记忆。除了使用有监督的二分匹配来获得事件记忆外,我们还设计了一种无监督记忆生成方法,以摆脱对事件标注的依赖。接下来,在聚焦阶段,这些事件记忆充当桥梁,建立问题与高层事件概念和低层冗长视频内容之间的关联。给定问题,模型首先聚焦于生成的关键事件记忆,然后通过我们设计的多级交叉注意力机制聚焦于最相关的时刻进行推理。我们在四个多事件VideoQA基准(包括STAR、EgoTaskQA、AGQA和NExT-QA)上进行了广泛实验。我们提出的模型取得了最先进的结果,在各种具有挑战性的推理任务中超越了当前的大型模型。代码和模型可在https://github.com/ByZ0e/Glance-Focus获取。

关键词

引用

@article{arxiv.2401.01529,
  title  = {Glance and Focus: Memory Prompting for Multi-Event Video Question Answering},
  author = {Ziyi Bai and Ruiping Wang and Xilin Chen},
  journal= {arXiv preprint arXiv:2401.01529},
  year   = {2024}
}

备注

Accepted in NeurIPS 2023