中文

Pixel-in-Pixel Net:面向真实场景下高效人脸关键点检测

计算机视觉与模式识别 2021-09-14 v3

摘要

近来,热力图回归模型因其在定位人脸关键点方面的优越性能而变得流行。然而,这些模型仍存在三个主要问题:(1)计算开销大;(2)通常缺乏对全局形状的显式约束;(3)普遍存在域间隙。为解决这些问题,我们提出 Pixel-in-Pixel Net(PIPNet)用于人脸关键点检测。所提模型配备了一种基于热力图回归的新型检测头,可在低分辨率特征图上同时完成分数与偏移预测。如此一来,重复的上采样层不再必要,能够在牺牲模型精度的前提下大幅减少推理时间。此外,提出了一个简单而有效的邻域回归模块,通过融合来自相邻关键点的预测来施加局部约束,从而增强了新检测头的鲁棒性。为进一步提升 PIPNet 的跨域泛化能力,我们提出基于课程的自训练。该训练策略能够通过从较简单任务开始、再逐步增加难度以提供更精确标签的方式,从跨域无标签数据中挖掘更可靠的伪标签。大量实验证明了 PIPNet 的优越性,其在监督设定下六个流行基准中的三个上取得了最先进结果。在两个跨域测试集上的结果也相较基线得到一致提升。值得注意的是,我们的轻量版 PIPNet 在 CPU 和 GPU 上分别以 35.7 FPS 和 200 FPS 运行,同时仍保持与最先进方法相竞争的精度。PIPNet 的代码见 https://github.com/jhb86253817/PIPNet。

关键词

引用

@article{arxiv.2003.03771,
  title  = {Pixel-in-Pixel Net: Towards Efficient Facial Landmark Detection in the Wild},
  author = {Haibo Jin and Shengcai Liao and Ling Shao},
  journal= {arXiv preprint arXiv:2003.03771},
  year   = {2021}
}

备注

Accepted to IJCV