中文

基于深度多任务学习的手部图像理解

计算机视觉与模式识别 2021-07-29 v2

摘要

从图像或视频等多媒体材料中分析并理解手部信息对许多现实应用十分重要,并且在研究界保持活跃。已有多种工作专注于从单幅图像恢复手部信息,然而它们通常只解决单一任务,例如手部掩膜分割、2D/3D 手部姿态估计或手部网格重建,并且在具有挑战性的场景中表现不佳。为进一步提升这些任务的性能,我们提出了一种新颖的手部图像理解(HIU)框架,通过联合考虑这些任务间的关系,从单幅 RGB 图像中提取手部的全面信息。为实现该目标,设计了一个级联多任务学习(MTL)骨干网络来估计 2D 热力图、学习分割掩膜并生成中间 3D 信息编码,随后采用由粗到细的学习范式与自监督学习策略。定性实验表明,我们的方法即使在具挑战性的情况下也能恢复合理的网格表示。在定量上,我们的方法在多个广泛使用的数据集上,就多种评价指标而言,显著优于最先进的方法。

关键词

引用

@article{arxiv.2107.11646,
  title  = {Hand Image Understanding via Deep Multi-Task Learning},
  author = {Xiong Zhang and Hongsheng Huang and Jianchao Tan and Hongmin Xu and Cheng Yang and Guozhu Peng and Lei Wang and Ji Liu},
  journal= {arXiv preprint arXiv:2107.11646},
  year   = {2021}
}

备注

Accepted By ICCV 2021