中文

HD-EPIC:高度细化的体悟式视频数据集

计算机视觉与模式识别 2025-03-26 v2

摘要

我们提出了一个由新收集的厨房场景体悟式视频构成的验证数据集,包含手动标注的高度细化且相互关联的 ground-truth 标签,涵盖:食谱步骤、细粒度动作、带营养值的原料、移动物体以及音频标注。重要的是,所有标注都通过场景、fixture、物体位置的数字孪生体进行 3D 化,并以注视方向进行 priming。该数据集收集自多样化家庭环境中的非脚本化录像,使 HDEPIC 成为首个在野外收集但标注细节匹配受控实验室环境的详细数据集。我们通过一个包含 26K 个问题的有挑战性的 VQA 基准测试展示了高度细化标注的潜力,评估能力以识别食谱、原料、营养、细粒度动作、3D 感知、物体运动和注视方向。强大的长时序上下文 Gemini Pro 仅在该基准测试中取得 38.5% 的准确率,凸显了其困难性并揭示了当前视觉语言模型的不足。我们还评估了动作识别、声音识别和长期视频-物体分割在 HD-EPIC 上的表现。HD-EPIC 包含 41 小时的视频,覆盖 9 个厨房场景的数字孪生体,涵盖 413 个厨房 fixture,捕获 69 种食谱、5.9 万个细粒度动作、5.1 万个音频事件、2 万个物体运动和 3.7 万个物体掩码提升至 3D 空间。平均而言,我们每分钟的非脚本化视频都有 263 条标注。

关键词

引用

@article{arxiv.2502.04144,
  title  = {HD-EPIC: A Highly-Detailed Egocentric Video Dataset},
  author = {Toby Perrett and Ahmad Darkhalil and Saptarshi Sinha and Omar Emara and Sam Pollard and Kranti Parida and Kaiting Liu and Prajwal Gatti and Siddhant Bansal and Kevin Flanagan and Jacob Chalk and Zhifan Zhu and Rhodri Guerrier and Fahd Abdelazim and Bin Zhu and Davide Moltisanti and Michael Wray and Hazel Doughty and Dima Damen},
  journal= {arXiv preprint arXiv:2502.04144},
  year   = {2025}
}

备注

Accepted at CVPR 2025. Project Webpage and Dataset: http://hd-epic.github.io