基于描述文本监督利用多粒度上下文特征聚合改进人脸识别
计算机视觉与模式识别
2023-08-15 v1
摘要
我们提出描述文本引导的人脸识别(CGFR)作为一种新框架,用于提升商用现货(COTS)人脸识别(FR)系统的性能。与将软生物特征(例如面部标记、性别和年龄)与人脸图像结合不同,本工作中我们使用人脸检验员提供的面部描述作为辅助信息。然而,由于模态的异质性,直接融合文本与面部特征以提升性能非常困难,因为二者处于不同的嵌入空间。本文提出上下文特征聚合模块(CFAM),通过有效利用细粒度词-区域交互与全局图像-描述关联来解决该问题。具体而言,CFAM采用自注意力与交叉注意力机制,分别改善图像与文本特征之间的模态内与模态间关系。此外,我们设计文本特征精炼模块(TFRM),通过更新上下文嵌入来精炼预训练BERT编码器的文本特征。该模块借助跨模态投影损失增强文本特征的判别力,并通过引入视觉-语义对齐损失将词与描述嵌入同视觉特征重新对齐。我们在两种人脸识别模型(ArcFace与AdaFace)上实现所提CGFR框架,并在Multi-Modal CelebA-HQ数据集上评估其性能。我们的框架在1:1验证与1:N识别协议下均显著提升了ArcFace的性能。
引用
@article{arxiv.2308.06866,
title = {Improving Face Recognition from Caption Supervision with Multi-Granular Contextual Feature Aggregation},
author = {Md Mahedi Hasan and Nasser Nasrabadi},
journal= {arXiv preprint arXiv:2308.06866},
year = {2023}
}
备注
This article has been accepted for publication in the IEEE International Joint Conference on Biometrics (IJCB), 2023