中文

COM厨房:作为视觉-语言基准的未经编辑俯视视频数据集

计算机视觉与模式识别 2024-08-06 v1 计算与语言 多媒体

摘要

程序化视频理解正在获得视觉和语言社区的关注。深度学习视频分析需要大量数据。因此,现有方法常使用网络视频作为训练资源,这使得从原始视频观察中查询指令内容变得具有挑战性。为此,我们提出了新的数据集 COM Kitchens。该数据集由未经编辑的俯视视频组成,这些视频由智能手机拍摄,参与者根据给定食谱执行食物准备。固定视角的视频数据集常因摄像机 setup 成本高而缺乏环境多样性。我们利用现代广角智能手机镜头覆盖从水槽到炉灶的厨房操作台,实现俯视视角捕捉活动,无需现场协助。通过将智能手机分发给参与者,我们收集了多样化的数据集。我们提出了新的视频到文本检索任务 Online Recipe Retrieval(OnRR)以及新的视频描述任务 Dense Video Captioning on unedited Overhead-View videos(DVC-OV)。我们的实验验证了当前基于网页视频的 SOTA 方法在处理这些任务方面的能力与局限性。

关键词

引用

@article{arxiv.2408.02272,
  title  = {COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark},
  author = {Koki Maeda and Tosho Hirasawa and Atsushi Hashimoto and Jun Harashima and Leszek Rybicki and Yusuke Fukasawa and Yoshitaka Ushiku},
  journal= {arXiv preprint arXiv:2408.02272},
  year   = {2024}
}

备注

ECCV2024 accepted