ANetQA:面向未裁剪视频细粒度组合推理的大规模基准
计算机视觉与模式识别
2023-05-05 v1 计算与语言
摘要
构建基准以系统性分析视频问答(VideoQA)模型的不同能力具有挑战性却至关重要。现有基准常使用非组合的简单问题并受语言偏置影响,难以精准诊断模型弱点。近期基准 AGQA 提出了一种有前景的范式,从预标注场景图自动生成问答对,使其能以细粒度控制度量多样推理能力。然而,其问题在推理视频中细粒度语义方面存在局限,因该信息在其场景图中缺失。为此,我们提出 ANetQA,一个支持对来自 ActivityNet 的极具挑战性的未裁剪视频进行细粒度组合推理的大规模基准。与 AGQA 类似,ANetQA 中的问答对由标注视频场景图自动生成。ANetQA 的细粒度特性体现于:(i) 具细粒度语义的未裁剪视频;(ii) 具细粒度分类的时空场景图;(iii) 由细粒度模板生成的多样问题。ANetQA 包含 14 亿非平衡及 1340 万平衡问答对,比视频数相近的 AGQA 大一个数量级。我们对最先进方法进行了全面实验。最佳模型准确率为 44.5%,而人类性能达 84.5%,留有充足改进空间。
引用
@article{arxiv.2305.02519,
title = {ANetQA: A Large-scale Benchmark for Fine-grained Compositional Reasoning over Untrimmed Videos},
author = {Zhou Yu and Lixiang Zheng and Zhou Zhao and Fei Wu and Jianping Fan and Kui Ren and Jun Yu},
journal= {arXiv preprint arXiv:2305.02519},
year = {2023}
}
备注
Accepted at CVPR 2023, Project homepage at: https://milvlg.github.io/anetqa/