中文

基于多模态训练的单模态人脸分类

计算机视觉与模式识别 2021-12-09 v1

摘要

人脸识别是各种多媒体应用(如安检、凭证访问和体感游戏)中的一项关键任务。然而,当输入人脸存在噪声(如条件较差的 RGB 图像)或缺乏某些信息(如无颜色的 3D 人脸)时,该任务具有挑战性。在这项工作中,我们提出了一个用于鲁棒人脸分类的多模态训练单模态测试(MTUT)框架,该框架在训练期间利用跨模态关系,并在测试期间将其作为不完美单一模态输入的补充。具体而言,在训练期间,该框架 (1) 借助面部属性构建模态内和跨模态自编码器,以学习潜在嵌入作为多模态描述符;(2) 提出了一种新颖的多模态嵌入散度损失,以对齐来自不同模态的异构特征,这也自适应地避免了无用的模态(如果有的话)对模型的干扰。这样,所学习的自编码器能够在测试阶段的单模态人脸分类中生成鲁棒的嵌入。我们在两个人脸分类数据集和两种测试输入上评估了我们的框架:(1) 条件较差的图像和 (2) 点云或 3D 人脸网格,而训练时 2D 和 3D 模态均可用。我们通过实验表明,我们的 MTUT 框架在两个数据集的 2D 和 3D 设置上均持续优于十个基线方法。

关键词

引用

@article{arxiv.2112.04182,
  title  = {Unimodal Face Classification with Multimodal Training},
  author = {Wenbin Teng and Chongyang Bai},
  journal= {arXiv preprint arXiv:2112.04182},
  year   = {2021}
}

备注

Accepted by IEEE International Conference On Automatic Face and Gesture Recognition 2021