中文

野外域自适应手部关键点与像素定位

计算机视觉与模式识别 2022-07-15 v5 机器学习

摘要

我们旨在仅拥有在差异很大的条件(如室内)下拍摄的标注图像时,提升在新成像条件(如室外)下回归手部关键点与分割像素级手部掩码的性能。在真实世界中,为两项任务训练的模型能在各种成像条件下工作十分重要。然而,现有标注手部数据集所覆盖的变化有限。因此,有必要将基于标注图像(源域)训练的模型适配到具有未见成像条件的未标注图像(目标域)。尽管针对两项任务已开发出自训练域自适应方法(即以自监督方式从未标注目标图像中学习),但当目标图像上的预测含噪时,其训练可能使性能下降。为避免此问题,在自训练期间对含噪预测赋予低重要性(置信度)权重至关重要。本文中,我们提出利用两个预测的分歧来估计两项任务中目标图像的置信度。这些预测由两个不同的网络给出,其分歧有助于识别含噪预测。为将我们提出的置信度估计整合进自训练,我们提出一种师生框架,其中两个网络(教师)为单个网络(学生)提供监督以进行自训练,而教师通过知识蒸馏从学生中学习。我们的实验表明,在不同光照、抓握物体、背景与相机视角的适配设定下,其优于最先进(SOTA)方法。与最新对抗自适应方法相比,我们的方法在 HO3D 上的多任务分数提高了 4%。我们还在 Ego4D(具有室外成像条件快速变化的第一人称视频)上验证了方法。

关键词

引用

@article{arxiv.2203.08344,
  title  = {Domain Adaptive Hand Keypoint and Pixel Localization in the Wild},
  author = {Takehiko Ohkawa and Yu-Jhe Li and Qichen Fu and Ryosuke Furuta and Kris M. Kitani and Yoichi Sato},
  journal= {arXiv preprint arXiv:2203.08344},
  year   = {2022}
}

备注

Accepted to ECCV 2022