中文

Assembly101:用于理解程序性活动的大规模多视角视频数据集

计算机视觉与模式识别 2022-05-03 v2

摘要

Assembly101是一个新的程序性活动数据集,包含4321段人们组装和拆卸101种“可拆开”玩具车的视频。参与者在无固定指令下工作,这些序列在动作顺序、错误和纠正方面具有丰富而自然的差异。Assembly101是首个多视角动作数据集,具有同步的静态(8个)和第一人称(4个)录制。序列标注有超过10万段粗粒度及100万段细粒度动作片段,以及1800万个人手三维姿态。我们在三项动作理解任务上进行了基准测试:识别、预测和时间分割。此外,我们提出了一项检测错误的新任务。独特的录制格式和丰富的标注集使我们能够研究对新玩具的泛化、跨视角迁移、长尾分布以及姿态vs.外观。我们预期Assembly101将作为一个新挑战,用于研究各种活动理解问题。

关键词

引用

@article{arxiv.2203.14712,
  title  = {Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural Activities},
  author = {Fadime Sener and Dibyadip Chatterjee and Daniel Shelepov and Kun He and Dipika Singhania and Robert Wang and Angela Yao},
  journal= {arXiv preprint arXiv:2203.14712},
  year   = {2022}
}

备注

CVPR 2022, https://assembly-101.github.io/