VideoNet:用于领域特定动作识别的大规模数据集
计算机视觉与模式识别
2026-05-06 v2 机器学习
摘要
视频独特地捕捉了超越多个帧的动作,因此多年来动作识别一直是视频理解的典型任务。然而,由于缺乏足够多样且具有挑战性的数据,现代视觉-语言模型(VLMs)不再在动作识别能力上进行评估。为此,我们倡导重新关注领域特定动作。为此,我们引入VideoNet,一个覆盖37个领域、包含1000种不同动作的领域特定动作识别基准。我们采用多选评估设置,其中封闭模型与开放模型之间的差距显著:Gemini 3.1 Pro达到了69.9%的准确率,而Qwen3-VL-8B仅达到45.0%。为了解为什么VLMs在VideoNet上表现不佳,我们放宽问题为二元设置,其中随机机会为50%。Qwen仍仅达到59.2%的准确率。进一步放宽评估设置,我们提供k∈{1,2,3}的情境示例。一些模型在少量样本设置中表现出色,而另一些则表现平平;Qwen提升了+7.0%,而Gemini下降了-4.8%。值得注意的是,这些收益远不到在给定少量样本示例时非专业人士的+13.6%提升。发现VLMs难以充分利用情境示例后,我们转向训练端。我们收集了首个用于领域特定动作的大规模训练数据集, nearly 50万视频问答对。在我们的数据上微调Molmo2-4B模型,我们在VideoNet基准上超越了所有开源8B模型。
引用
@article{arxiv.2605.02834,
title = {VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition},
author = {Tanush Yadav and Mohammadreza Salehi and Jae Sung Park and Vivek Ramanujan and Hannaneh Hajishirzi and Yejin Choi and Ali Farhadi and Rohun Tripathi and Ranjay Krishna},
journal= {arXiv preprint arXiv:2605.02834},
year = {2026}
}
备注
CVPR 2026 Highlight. Website at https://tanu.sh/videonet