中文

迈向细粒度视频问答

计算机视觉与模式识别 2025-03-11 v1 人工智能 机器学习

摘要

在快速发展的视频理解领域,视频问答(VideoQA)仍然是一个焦点。然而,现有数据集在时间粒度和空间粒度上存在差距,从而限制了现有 VideoQA 方法的能力。本文提出了多对象多主体问答(MOMA-QA)数据集,旨在通过强调时间定位、空间关系推理和实体中心查询来解决这些不足。该数据集具有真实场景图和时间区间标注,是开发细粒度视频理解模型的理想选择。此外,我们提出了一种新型视频语言模型 SGVLM,它包含场景图预测器、高效帧检索器和预训练大语言模型,用于时间定位和细粒度关系理解。在 MOMA-QA 和其他公共数据集上的评估证明了我们模型的优越性能,为 VideoQA 设立了新的基准。

关键词

引用

@article{arxiv.2503.06820,
  title  = {Towards Fine-Grained Video Question Answering},
  author = {Wei Dai and Alan Luo and Zane Durante and Debadutta Dash and Arnold Milstein and Kevin Schulman and Ehsan Adeli and Li Fei-Fei},
  journal= {arXiv preprint arXiv:2503.06820},
  year   = {2025}
}