通过文本编码诱导面部识别模板中的人口统计学模糊性以缓解偏见
计算机视觉与模式识别
2025-12-11 v1 人工智能
摘要
人脸识别(FR)系统常常容易产生人口统计学偏见,部分原因是人口统计学特定信息与身份相关特征在面部嵌入表示中被纠缠。这种偏见在大型多文化城市中尤为关键,尤其是当生物识别技术在智慧城市基础设施中发挥主要作用时。这种纠缠会导致人口统计学属性在嵌入空间中凌驾于身份线索之上,导致不同人口统计学群体的验证性能存在差异。为解决此问题,我们提出一种新颖策略,统一文本-图像嵌入(UTIE),旨在通过与其他人口统计学群体相关信息丰富面部嵌入,来诱导人口统计学模糊性。这鼓励面部嵌入强调身份相关特征,从而促进跨群体的更公平验证性能。UTIE 利用视觉语言模型(VLM)的零样能力与跨模态语义对齐。鉴于 VLM 本质上被训练用于对齐视觉与文本表征,我们通过提取自其他人口统计学群体的文本派生人口统计学特征来丰富每个人口统计学群体的面部嵌入。这鼓励以人口统计学属性为更中性的表示。我们使用 CLIP、OpenCLIP 和 SigLIP 三种 VLM,在设计用于评估 FR 偏见的两个广泛使用的数据集(RFW 和 BFW)上进行评估。实验结果表明,UTIE 在保持甚至在几种情况下提升面部验证准确率的同时,一致显著降低了偏见指标。
引用
@article{arxiv.2512.08981,
title = {Mitigating Bias with Words: Inducing Demographic Ambiguity in Face Recognition Templates by Text Encoding},
author = {Tahar Chettaoui and Naser Damer and Fadi Boutros},
journal= {arXiv preprint arXiv:2512.08981},
year = {2025}
}
备注
Accepted at BMVC workshop (SRBS) 2025