Action100M: 大规模视频动作数据集
计算机视觉与模式识别
2026-01-16 v1
摘要
从视觉观察中推断物理动作是推进机器智能在物理世界中能力的基本任务。实现这一目标需要大规模、开放词汇表的视频动作数据集,以涵盖广泛领域。我们介绍 Action100M,一个由 120 万个互联网教学视频(时长 14.6 年)构建的大规模数据集,产生约 1 亿个具有开放词汇表动作监督和丰富标题的时空局部化片段。Action100M 通过一个完全自动化的管道构建:(i) 使用 V-JEPA 2 嵌入进行层次时序分割,(ii) 生成多层次帧和片段标题组织为树状标题结构 (Tree-of-Captions),(iii) 使用推理模型 (GPT-OSS-120B) 在多轮自我完善程序下聚合证据,以输出结构化注释(简要/详细动作、演员、简要/详细标题)。在 Action100M 上训练 VL-JEPA 显示出一致的数据规模提升和在多样化动作识别基准测试中的强大零样本性能,确立了 Action100M 作为可扩展研究在视频理解和世界建模中的新基准。
引用
@article{arxiv.2601.10592,
title = {Action100M: A Large-scale Video Action Dataset},
author = {Delong Chen and Tejaswi Kasarla and Yejin Bang and Mustafa Shukor and Willy Chung and Jade Yu and Allen Bolourchi and Theo Moutakanni and Pascale Fung},
journal= {arXiv preprint arXiv:2601.10592},
year = {2026}
}