中文

ATTN-FIQA:基于 Vision Transformer 的可解释注意力面部图像质量评估

计算机视觉与模式识别 2026-04-28 v1 图像与视频处理

摘要

面部图像质量评估(FIQA)旨在评估面部样本的识别效用,对可靠的面部识别(FR)系统至关重要。现有方法需要计算密集的程序,如多次前向传播、反向传播或额外训练,仅近期工作聚焦于 Vision Transformer 的使用。近期研究指出,这些架构本质上作为 saliency learner,注意力模式天然编码空间重要性。本工作提出 ATTN-FIQA,一种无训练的新方法,探讨预训练 Vision Transformer 面部识别模型中 pre-softmax 注意力得分是否可作为质量指示器。我们假设注意力大小本质上编码了质量信息:高质量图像具有判别性面部特征可产生强查询-键对齐,从而产生集中且高幅值的注意力模式,而退化图像则产生分散且低幅值的模式。ATTN-FIQA 从最终 transformer 块中提取 pre-softmax 注意力矩阵,对所有 patch 上的多头注意力信息进行聚合,并通过简单平均计算图像级质量得分,仅需通过预训练模型进行单次前向传播,无需架构修改、反向传播或额外训练。通过在八个基准数据集和四个 FR 模型上的全面评估,本工作证明注意力基于的质量得分有效地与面部图像质量相关,并提供空间可解释性,揭示哪些面部区域对质量判断贡献最大。

关键词

引用

@article{arxiv.2604.22841,
  title  = {ATTN-FIQA: Interpretable Attention-based Face Image Quality Assessment with Vision Transformers},
  author = {Guray Ozgur and Tahar Chettaoui and Eduarda Caldeira and Jan Niklas Kolf and Marco Huber and Andrea Atzori and Naser Damer and Fadi Boutros},
  journal= {arXiv preprint arXiv:2604.22841},
  year   = {2026}
}

备注

Accepted at FG2026