重新审视无参考图像质量评估中的视觉语言基础
计算机视觉与模式识别
2026-03-17 v2
摘要
大规模视觉语言预训练最近在无参考图像质量评估 (NR-IQA) 中展现出前景,但现代视觉转换器基础设施的相对优势仍鲜有人知。在本工作中,我们首次系统评估了六个突出的预训练主干网络——CLIP、SigLIP2、DINOv2、DINOv3、Perception 和 ResNet——用于无参考图像质量评估 (NR-IQA) 任务,每个主干网络均使用相同的轻量级 MLP 头进行微调。我们的研究发现,两个先前被忽视的因素:(1) SigLIP2 持续实现强劲性能;(2) 激活函数的选择在提升图像质量评估模型泛化能力方面发挥了惊人的关键作用。值得注意的是,我们发现简单的节点激活函数在多个基准测试中优于常用的 ReLU 和 GELU。鼓励这一发现,我们引入一种可学习的激活选择机制,自适应确定每个通道的非线性函数,从而无需手动设计激活函数,实现了在 CLIVE、KADID10K 和 AGIQA3K 上的 SRCC 新纪录。广泛的消融实验确认了在不同架构和情景下的优势,建立了强大且资源高效的 NR-IQA 基线。
引用
@article{arxiv.2509.17374,
title = {Revisiting Vision Language Foundations for No-Reference Image Quality Assessment},
author = {Ankit Yadav and Ta Duc Huy and Lingqiao Liu},
journal= {arXiv preprint arXiv:2509.17374},
year = {2026}
}
备注
23 pages, 16 figures. Accepted at WACV 2026