扩展第一人称视觉:EPIC-KITCHENS 数据集
计算机视觉与模式识别
2018-08-01 v2
摘要
第一人称视觉正引起越来越多的关注,因为它提供了关于人们与物体交互、注意力甚至意图的独特视角。然而,由于缺少足够大规模的数据集,这一具有挑战性的领域进展相对缓慢。在本文中,我们介绍了 EPIC-KITCHENS,这是一个由 32 名参与者在其原生厨房环境中录制的大规模第一人称视频基准。我们的视频描绘了非脚本的日常活动:我们只是要求每位参与者每次进入厨房时开始录制。录制在 4 个城市(位于北美和欧洲)进行,参与者分属 10 个不同国籍,从而产生了高度多样化的烹饪风格。我们的数据集包含 55 小时视频,共计 11.5M 帧,我们对其进行了密集标注,共得到 39.6K 个动作片段和 454.3K 个物体边界框。我们的标注独特之处在于让参与者自己叙述其视频(录制后),从而反映真实意图,并基于这些叙述通过众包获得真值。我们描述了我们的物体、动作和预期挑战,并在两个测试划分(已见厨房和未见厨房)上评估了若干基线方法。数据集与项目页面:http://epic-kitchens.github.io
引用
@article{arxiv.1804.02748,
title = {Scaling Egocentric Vision: The EPIC-KITCHENS Dataset},
author = {Dima Damen and Hazel Doughty and Giovanni Maria Farinella and Sanja Fidler and Antonino Furnari and Evangelos Kazakos and Davide Moltisanti and Jonathan Munro and Toby Perrett and Will Price and Michael Wray},
journal= {arXiv preprint arXiv:1804.02748},
year = {2018}
}
备注
European Conference on Computer Vision (ECCV) 2018 Dataset and Project page: http://epic-kitchens.github.io