中文

面向图像质量评估的视觉-语言模型知识蒸馏方法

计算机视觉与模式识别 2025-07-24 v3

摘要

图像质量评估(IQA)是计算机视觉中的核心任务。基于视觉-语言模型(如CLIP)的多模态方法已在IQA任务中展现出卓越的泛化能力。为解决CLIP在IQA中参数负担过重且难以识别局部失真特征的问题,本研究提出一种视觉-语言模型知识蒸馏方法,旨在利用CLIP的IQA知识引导具有架构优势的模型训练。首先,设计质量分级提示模板以引导CLIP输出质量分数;然后,对CLIP进行微调以增强其在IQA任务中的能力;最后,提出一种模态自适应知识蒸馏策略,实现从CLIP教师模型到学生模型的引导。我们在多个IQA数据集上进行了实验,结果表明,所提方法在显著降低模型复杂度的同时,性能优于现有IQA方法,展现出强大的实际部署潜力。

关键词

引用

@article{arxiv.2507.15680,
  title  = {Visual-Language Model Knowledge Distillation Method for Image Quality Assessment},
  author = {Yongkang Hou and Jiarun Song},
  journal= {arXiv preprint arXiv:2507.15680},
  year   = {2025}
}