细粒度第一人称手-物分割:数据集、模型与应用
计算机视觉与模式识别
2022-08-09 v1
摘要
第一人称视频为对人类行为的高保真建模提供了细粒度信息。手和交互物体是理解观看者行为和意图的一个关键方面。我们提供了一个标注数据集,包含11,243张第一人称图像,带有在多种日常活动中交互的手和物体的逐像素分割标签。我们的数据集是首个标注详细手-物接触边界的数据集。我们引入了一种上下文感知的组合数据增强技术,以适应分布外的YouTube第一人称视频。我们展示了我们鲁棒的手-物分割模型和数据集可作为基础工具,提升或启用若干下游视觉应用,包括手状态分类、视频活动识别、手-物交互的3D网格重建,以及第一人称视频中手-物前景的视频修复。数据集和代码可在 https://github.com/owenzlz/EgoHOS 获取。
引用
@article{arxiv.2208.03826,
title = {Fine-Grained Egocentric Hand-Object Segmentation: Dataset, Model, and Applications},
author = {Lingzhi Zhang and Shenghao Zhou and Simon Stent and Jianbo Shi},
journal= {arXiv preprint arXiv:2208.03826},
year = {2022}
}
备注
25 pages, 17 figures, ECCV 2022