迈向细粒度视频问答
计算机视觉与模式识别
2025-03-11 v1 人工智能
机器学习
摘要
在快速发展的视频理解领域,视频问答(VideoQA)仍然是一个焦点。然而,现有数据集在时间粒度和空间粒度上存在差距,从而限制了现有 VideoQA 方法的能力。本文提出了多对象多主体问答(MOMA-QA)数据集,旨在通过强调时间定位、空间关系推理和实体中心查询来解决这些不足。该数据集具有真实场景图和时间区间标注,是开发细粒度视频理解模型的理想选择。此外,我们提出了一种新型视频语言模型 SGVLM,它包含场景图预测器、高效帧检索器和预训练大语言模型,用于时间定位和细粒度关系理解。在 MOMA-QA 和其他公共数据集上的评估证明了我们模型的优越性能,为 VideoQA 设立了新的基准。
引用
@article{arxiv.2503.06820,
title = {Towards Fine-Grained Video Question Answering},
author = {Wei Dai and Alan Luo and Zane Durante and Debadutta Dash and Arnold Milstein and Kevin Schulman and Ehsan Adeli and Li Fei-Fei},
journal= {arXiv preprint arXiv:2503.06820},
year = {2025}
}