EPIC-KITCHENS VISOR 基准:视频分割与物体关系
计算机视觉与模式识别
2022-09-28 v1 人工智能
机器学习
摘要
我们介绍 VISOR,一个用于第一视角视频中手部与主动物体分割的像素标注新数据集及基准套件。VISOR 标注来自 EPIC-KITCHENS 的视频,其带来当前视频分割数据集中未遇到的新挑战。具体而言,我们需要确保在物体经历变换性交互(例如洋葱被剥皮、切丁和烹饪——我们旨在获得果皮、洋葱块、砧板、刀、锅以及操作手的准确像素级标注)时像素级标注的短期与长期一致性。VISOR 引入了部分由 AI 驱动的标注流水线,以实现可扩展性与质量。总计,我们公开发布 272K 个 257 个物体类别的手动语义掩码、9.9M 个插值稠密掩码、67K 个手-物关系,覆盖 36 小时 179 段未剪辑视频。随标注一同,我们引入视频物体分割、交互理解与长期推理三项挑战。数据、代码与排行榜见:http://epic-kitchens.github.io/VISOR
引用
@article{arxiv.2209.13064,
title = {EPIC-KITCHENS VISOR Benchmark: VIdeo Segmentations and Object Relations},
author = {Ahmad Darkhalil and Dandan Shan and Bin Zhu and Jian Ma and Amlan Kar and Richard Higgins and Sanja Fidler and David Fouhey and Dima Damen},
journal= {arXiv preprint arXiv:2209.13064},
year = {2022}
}
备注
10 pages main, 38 pages appendix. Accepted at NeurIPS 2022 Track on Datasets and Benchmarks Data, code and leaderboards from: http://epic-kitchens.github.io/VISOR