ViT-FIQA: 用于视觉转换器的人脸图像质量评估
计算机视觉与模式识别
2025-08-25 v3
摘要
人脸图像质量评估 (FIQA) 旨在预测人脸图像在人脸识别 (FR) 系统中使用的实用性。当前领域的先进 FIQA 方法主要依赖卷积神经网络 (CNN),而视觉转换器 (ViT) 架构的潜力尚未得到充分探索。本文提出 ViT-FIQA,一种新方法,通过设计可学习的质量标记(quality token)来扩展标准 ViT 主干网络(原为 FR 优化),用于预测给定人脸图像的标量实用性得分。该可学习的质量标记被拼接到标准图像补丁标记上,整个序列通过 ViT 编码器的全局自注意力机制处理,以跨所有补丁聚合上下文信息。在主干网络输出端,ViT-FIQA 分支为两个头:(1) 将补丁标记通过全连接层传递,以通过边际惩罚 softmax loss 学习判别性人脸表征;(2) 将质量标记输入回归头,以学习预测人脸样本实用性。在具有挑战性的基准数据集上进行大量实验,并针对包括 CNN 和 ViT 架构在内的多种 FR 模型进行测试,结果表明 ViT-FIQA 在所有指标上均实现了领先的性能。这些结果凸显了基于转换器的架构在建模人脸图像实用性方面的有效性,并突显了 ViT 作为面向未来 FIQA 研究可扩展基础的潜力 https://cutt.ly/irHlzXUC。
引用
@article{arxiv.2508.13957,
title = {ViT-FIQA: Assessing Face Image Quality using Vision Transformers},
author = {Andrea Atzori and Fadi Boutros and Naser Damer},
journal= {arXiv preprint arXiv:2508.13957},
year = {2025}
}
备注
Accepted at the IEEE/CVF International Conference on Computer Vision Workshops 2025 (ICCVW 2025)