中文

基于长时段环视视频的 grounding 多跳视频问答

计算机视觉与模式识别 2024-08-27 v1

摘要

本文考虑了长时段环视视频中多跳视频问答(MH-VidQA)的问题。这一任务不仅需要回答视觉问题,还需要在视频中局部多个相关时间区间作为视觉证据。我们开发了一个自动化管道,用于创建带关联时间证据的多跳问答对,从而构建大规模指令调优数据集。为监控这一新任务的进展,我们进一步精心筛选并细化了一个高质量基准数据集MultiHop-EgoQA。实验结果表明,现有的多模态系统在多跳 grounding 与推理方面能力不足,导致表现不佳。我们随后提出了一种新型架构,称为基于大语言模型的 scattered evidence grounding(GeLM),通过引入 grounding 模块来检索使用灵活 grounding token 从视频中检索时间证据。在我们的视觉指令数据上训练的GeLM展示出改进的多跳 grounding 与推理能力,为这一具有挑战性的任务设定了新的基准。此外,当在第三人称视角视频上训练时,相同的架构也在单跳 VidQA 基准(ActivityNet-RTL)上实现了最先进的性能,表明其有效性。

关键词

引用

@article{arxiv.2408.14469,
  title  = {Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos},
  author = {Qirui Chen and Shangzhe Di and Weidi Xie},
  journal= {arXiv preprint arXiv:2408.14469},
  year   = {2024}
}