中文

重新扩展以自我为中心的视觉

计算机视觉与模式识别 2021-09-20 v4 机器学习

摘要

本文介绍了扩展以自我为中心视觉中最大数据集 EPIC-KITCHENS 的流程。该工作最终形成 EPIC-KITCHENS-100,其包含 100 小时、2000 万帧、9 万次动作,收录于 700 个变长视频中,使用头戴式相机在 45 个环境中捕捉长期的未脚本化活动。相较于前一版本,EPIC-KITCHENS-100 采用一种新颖的流程进行标注,实现了更密集(每分钟多 54% 的动作)且更完整的细粒度动作标注(动作片段增加 128%)。该数据集支持诸如动作检测及评估“时间考验”——即 2018 年收集数据上训练的模型能否泛化到两年后采集的新影像——等新挑战。数据集对齐 6 项挑战:动作识别(全监督与弱监督)、动作检测、动作预期、跨模态检索(基于文本描述),以及面向动作识别的无监督域适应。针对每项挑战,我们定义了任务、提供基线方法与评估指标。

关键词

引用

@article{arxiv.2006.13256,
  title  = {Rescaling Egocentric Vision},
  author = {Dima Damen and Hazel Doughty and Giovanni Maria Farinella and Antonino Furnari and Evangelos Kazakos and Jian Ma and Davide Moltisanti and Jonathan Munro and Toby Perrett and Will Price and Michael Wray},
  journal= {arXiv preprint arXiv:2006.13256},
  year   = {2021}
}

备注

Accepted at the International Journal of Computer Vision (IJCV). Dataset available from: http://epic-kitchens.github.io/