中文

EPFL-Smart-Kitchen-30:包含 3D 运动学数据的密集标注烹饪数据集,用于挑战视频与语言模型

计算机视觉与模式识别 2025-08-26 v2 人工智能 机器学习 其他定量生物学

摘要

理解行为需要捕捉人类执行复杂任务的数据集。厨房是评估人类运动和认知功能的极佳环境,因为从切菜到清洁,许多复杂动作都在厨房中自然展现。在此,我们介绍在厨房环境内的非侵入式动作捕捉平台上采集的 EPFL-Smart-Kitchen-30 数据集。使用九个静态 RGB-D 相机、惯性测量单元(IMU)和一个头戴式 HoloLens 2 头显来捕捉 3D 手部、身体和眼部运动。EPFL-Smart-Kitchen-30 数据集是一个多视角动作数据集,包含同步的第三人称视角、第一人称视角、深度、IMU、眼动、身体和手部运动学数据,跨越 16 名受试者烹饪四种不同配方的 29.7 小时。动作序列被密集标注,每分钟包含 33.78 个动作片段。利用这一多模态数据集,我们提出了四个基准测试,通过以下方式推进行为理解与建模:1) 视觉-语言基准测试,2) 语义文本到动作生成基准测试,3) 多模态动作识别基准测试,4) 基于姿态的动作分割基准测试。我们期望 EPFL-Smart-Kitchen-30 数据集能为更好的方法以及理解生态学有效人类行为的本质铺平道路。代码和数据可在 https://github.com/amathislab/EPFL-Smart-Kitchen 获取。

关键词

引用

@article{arxiv.2506.01608,
  title  = {EPFL-Smart-Kitchen-30: Densely annotated cooking dataset with 3D kinematics to challenge video and language models},
  author = {Andy Bonnetto and Haozhe Qi and Franklin Leong and Matea Tashkovska and Mahdi Rad and Solaiman Shokur and Friedhelm Hummel and Silvestro Micera and Marc Pollefeys and Alexander Mathis},
  journal= {arXiv preprint arXiv:2506.01608},
  year   = {2025}
}

备注

Code and data at: https://github.com/amathislab/EPFL-Smart-Kitchen