中文

细粒度第一人称手-物分割:数据集、模型与应用

计算机视觉与模式识别 2022-08-09 v1

摘要

第一人称视频为对人类行为的高保真建模提供了细粒度信息。手和交互物体是理解观看者行为和意图的一个关键方面。我们提供了一个标注数据集,包含11,243张第一人称图像,带有在多种日常活动中交互的手和物体的逐像素分割标签。我们的数据集是首个标注详细手-物接触边界的数据集。我们引入了一种上下文感知的组合数据增强技术,以适应分布外的YouTube第一人称视频。我们展示了我们鲁棒的手-物分割模型和数据集可作为基础工具,提升或启用若干下游视觉应用,包括手状态分类、视频活动识别、手-物交互的3D网格重建,以及第一人称视频中手-物前景的视频修复。数据集和代码可在 https://github.com/owenzlz/EgoHOS 获取。

关键词

引用

@article{arxiv.2208.03826,
  title  = {Fine-Grained Egocentric Hand-Object Segmentation: Dataset, Model, and Applications},
  author = {Lingzhi Zhang and Shenghao Zhou and Simon Stent and Jianbo Shi},
  journal= {arXiv preprint arXiv:2208.03826},
  year   = {2022}
}

备注

25 pages, 17 figures, ECCV 2022