EPIC-KITCHENS 数据集:采集、挑战与基线
计算机视觉与模式识别
2020-05-04 v1
摘要
自 2018 年推出以来,EPIC-KITCHENS 作为最大的以自我为中心的视频基准吸引了广泛关注,提供了关于人与物体交互、注意力乃至意图的独特视角。在本文中,我们详述了这一大规模数据集如何由 32 名参与者在其原生厨房环境中采集,并密集标注了动作与物体交互。我们的视频描绘了非脚本的日常活动,因为每次参与者进入厨房时即开始录制。录制在 4 个国家由属于 10 种不同国籍的参与者完成,由此产生了高度多样的厨房习惯与烹饪风格。我们的数据集包含 55 小时视频,共 11.5M 帧,我们对其进行了密集标注,总计 39.6K 个动作片段与 454.2K 个物体边界框。我们的标注独特之处在于让参与者在录制后自行旁白其视频,从而反映真实意图,并基于这些旁白通过众包获得真值。我们描述了物体、动作与预期挑战,并在两个测试划分(见过的与未见过的厨房)上评估了若干基线。我们引入了新基线,凸显了数据集的多模态特性以及显式时间建模对于区分细粒度动作(例如将“关闭水龙头”与“打开”水龙头区分开)的重要性。
引用
@article{arxiv.2005.00343,
title = {The EPIC-KITCHENS Dataset: Collection, Challenges and Baselines},
author = {Dima Damen and Hazel Doughty and Giovanni Maria Farinella and Sanja Fidler and Antonino Furnari and Evangelos Kazakos and Davide Moltisanti and Jonathan Munro and Toby Perrett and Will Price and Michael Wray},
journal= {arXiv preprint arXiv:2005.00343},
year = {2020}
}
备注
Preprint for paper at IEEE TPAMI. arXiv admin note: substantial text overlap with arXiv:1804.02748