中文

以自我为中心的 hand-object 交互检测及应用

计算机视觉与模式识别 2021-10-01 v1

摘要

在本文中,我们提出了一种从以自我为中心的视角检测手-物交互的方法。与基于海量数据驱动判别器的方法(如Shan等人\cite{Shan20})不同,我们提出了一种利用手和物体线索的新颖流程。具体而言,我们训练预测手部姿态、手部掩码和手中物体掩码的网络,以联合预测手-物交互状态。我们在EPIC-KITCHENS \cite{damen2018scaling}数据集的选定图像上与Shan等人\cite{Shan20}的最新工作进行比较,在HOI(手-物交互)检测上达到89%的准确率,与Shan的(92%)相当。然而,对于实时性能,在同一台机器上,我们的方法可以运行超过30 FPS,比Shan的(1~2 FPS)高效得多。此外,借助我们的方法,我们能够从无脚本活动中分割出帧,从中提取具有HOI状态检测的帧。我们在GTEA \cite{fathi2011learning}和UTGrasp \cite{cai2015scalable}数据集上分别达到68.2%和82.8%的F1分数,均与SOTA方法相当。

关键词

引用

@article{arxiv.2109.14734,
  title  = {Egocentric Hand-object Interaction Detection and Application},
  author = {Yao Lu and Walterio W. Mayol-Cuevas},
  journal= {arXiv preprint arXiv:2109.14734},
  year   = {2021}
}