中文

以深度为注意力的人脸表征学习

计算机视觉与模式识别 2021-04-06 v2

摘要

人脸表征学习方案近期在验证与识别等多种应用中取得了巨大成功。然而,纯粹基于 RGB 图像的人脸识别方法仅依赖强度信息,因而对面部变化(尤其是姿态、遮挡以及光照和背景等环境变化)更为敏感。本文提出一种新颖的深度引导注意力机制,用于基于低成本 RGB-D 传感器的深度多模态人脸识别。我们的新颖注意力机制通过由卷积神经网络(CNN)提取的深度特征聚焦网络注意力,指导深度网络“在 RGB 图像中何处寻找”视觉特征。深度特征帮助网络聚焦于 RGB 图像中包含更显著个体特定信息的面部区域。我们的注意力机制随后利用此相关性,由 CNN 提取的深度特征生成 RGB 图像的注意力图。我们在四个公开数据集上测试了我们的网络,结果表明,在包含姿态、遮挡、光照、表情和时间跨度等挑战性变化的 Lock3DFace、CurtinFaces、IIIT-D RGB-D 和 KaspAROV 数据集上,我们所提方案获得的特性能取得更优结果。我们的方案在四个数据集上分别实现了 87.3%(+5.0%)、99.1%(+0.9%)、99.7%(+0.6%)和 95.3%(+0.5%)的平均(提升)准确率,从而改进了当前最优水平。我们还使用热成像图像替代深度图像进行了额外实验,显示出当采用其他模态替代深度信息引导注意力机制时,我们的方案具有很高的泛化能力。

关键词

引用

@article{arxiv.2101.00652,
  title  = {Depth as Attention for Face Representation Learning},
  author = {Hardik Uppal and Alireza Sepas-Moghaddam and Michael Greenspan and Ali Etemad},
  journal= {arXiv preprint arXiv:2101.00652},
  year   = {2021}
}

备注

16 pages, 11 figures, Accepted to IEEE Transactions on Information Forensics and Security 2021