EX-FIQA:利用 Vision Transformer 中间早退出表示进行面部图像质量评估
计算机视觉与模式识别
2026-04-28 v1 图像与视频处理
摘要
面部图像质量评估对于可靠的面部识别系统至关重要,但现有的 Vision Transformer 方法仅依赖最终层表示,忽略了中间网络深度捕获的质量相关信息。本文首次系统性地探讨了中间表示如何通过早退出机制和得分融合策略贡献于面部质量评估。我们系统性地分析了 ViT-FIQA 架构中全部 12 个 transformer 块,证明不同深度捕获的质量相关信息具有不同且互补的特征,证据在注意力模式和性能特征跨网络层之间呈现差异。我们提出一种得分融合框架,将多个 transformer 块的质量预测组合在内,无需架构修改或额外训练。我们的早退出分析揭示了最佳性能-效率权衡,使我们能够在保持竞争性能的同时实现显著的计算节省。通过在八个基准数据集上使用四个 FR 模型进行广泛评估,我们证明了融合策略优于单退出方法。我们提出的质量融合方法采用深度加权平均,为更深层的 transformer 块分配 progressively 更高的重要性,通过有效利用 ViT 中层次特征学习的特性,实现最佳质量评估性能。我们的工作挑战了仅深层特征 matters for face analysis 的常规观念,揭示了中间表示对质量评估具有重要价值。该框架为实际生物识别系统提供了实际收益,使我们能够在资源受限情况下实现自适应计算,同时保持具竞争力的质量评估能力。
引用
@article{arxiv.2604.22842,
title = {EX-FIQA: Leveraging Intermediate Early eXit Representations from Vision Transformers for Face Image Quality Assessment},
author = {Guray Ozgur and Tahar Chettaoui and Eduarda Caldeira and Jan Niklas Kolf and Andrea Atzori and Fadi Boutros and Naser Damer},
journal= {arXiv preprint arXiv:2604.22842},
year = {2026}
}
备注
Accepted at FG2026