ViTNT-FIQA:基于视觉变换器的免训练人脸图像质量评估
计算机视觉与模式识别
2026-01-12 v1 机器学习
摘要
人脸图像质量评估(FIQA)对于可靠的人脸识别系统至关重要。当前的方法主要仅利用最终层的表示,而免训练方法则需要多次前向传播或反向传播。我们提出了 ViTNT-FIQA,这是一种免训练的方法,用于测量跨视觉变换器(ViT)中间块的图像块嵌入演化的稳定性。我们证明,高质量的人脸图像在跨块时表现出稳定的特征细化轨迹,而退化图像则显示出不稳定的变换。我们的方法计算来自连续变换器块的 L2 归一化图像块嵌入之间的欧几里得距离,并将它们聚合成图像级别的质量分数。我们在一个具有受控退化水平的质量标记合成数据集上实证验证了这种相关性。与现有的免训练方法不同,ViTNT-FIQA 仅需单次前向传播,无需反向传播或架构修改。通过在八个基准(LFW、AgeDB-30、CFP-FP、CALFW、Adience、CPLFW、XQLFW、IJB-C)上的广泛评估,我们表明 ViTNT-FIQA 在保持计算效率和可立即应用于任何预训练的基于 ViT 的人脸识别模型的同时,取得了与最先进方法竞争的性能。
引用
@article{arxiv.2601.05741,
title = {ViTNT-FIQA: Training-Free Face Image Quality Assessment with Vision Transformers},
author = {Guray Ozgur and Eduarda Caldeira and Tahar Chettaoui and Jan Niklas Kolf and Marco Huber and Naser Damer and Fadi Boutros},
journal= {arXiv preprint arXiv:2601.05741},
year = {2026}
}
备注
Accepted at WACV Workshops