VideoMind:用于深度认知视频理解的 Omni-Modal 视频数据集
计算机视觉与模式识别
2025-07-25 v1 人工智能
摘要
本文介绍 VideoMind,这是一个视频中心的 Omni-Modal 数据集,旨在实现深度视频内容认知和增强多模态特征表示。该数据集包含 103K 个视频样本(其中 3K 用于测试),每个视频配有音频并经过系统化的文本描述。具体而言,每个视频及其音频在三个层次结构上进行描述(事实层、抽象层和意图层),从表层到深层。该数据集包含超过 2200 万个单词,平均约 225 个单词/样本。VideoMind 与现有数据集的关键区别在于提供意图表达,这些表达需要跨越整个视频进行上下文集成,无法直接观察。这些深层认知表达采用链式思考(COT)方法生成,通过逐步推理驱动大语言模型。每段描述包括主体、地点、时间、事件、动作和意图的标注,支持下游识别任务。我们建立了一个包含 3000 个人工验证样本的金标准基准,用于评估深度视频理解。我们设计了混合认知检索实验,采用多层次检索指标进行评估,以恰当地衡量深度视频理解。我们公开了模型(如 InternVideo、VAST、UMT-L)的评估结果。VideoMind 是进行细粒度跨模态对齐的强大基准,推动了需要深入视频理解的领域,如情感和意图识别。数据已公开于 GitHub、HuggingFace 和 OpenDataLab,链接为 https://github.com/cdx-cindy/VideoMind。
关键词
引用
@article{arxiv.2507.18552,
title = {VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding},
author = {Baoyao Yang and Wanyun Li and Dixin Chen and Junxiang Chen and Wenbin Yao and Haifeng Lin},
journal= {arXiv preprint arXiv:2507.18552},
year = {2025}
}
备注
7 pages; 14 figures