通过像素级视觉提示实现 mPLUG-Owl2 针对无参考图像质量评估的参数高效适配
计算机视觉与模式识别
2025-09-09 v2
摘要
在本文中,我们提出了一种用于无参考图像质量评估(NR-IQA)的新型参数高效适配方法,该方法使用在像素空间中优化的视觉提示。与多模态大语言模型(MLLM)的全量微调不同,我们的方法最多仅训练 600K 参数(不到基础模型的 0.01%),同时保持底层模型完全冻结。在推理过程中,这些视觉提示通过加法与图像结合,并由 mPLUG-Owl2 处理,文本查询为“Rate the technical quality of the image.”。在 KADID-10k、KonIQ-10k 和 AGIQA-3k 上跨不同失真类型(合成的、真实的、AI 生成的)的评估表明,该方法与全量微调方法和专门的 NR-IQA 模型相比具有竞争力的性能,在 KADID-10k 上实现了 0.93 的 SRCC。据我们所知,这是第一项利用像素空间视觉提示进行 NR-IQA 的工作,实现了 MLLM 在低层视觉任务中的高效适配。源代码公开于 https: // github. com/ yahya-ben/ mplug2-vp-for-nriqa。
引用
@article{arxiv.2509.03494,
title = {Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA},
author = {Yahya Benmahane and Mohammed El Hassouni},
journal= {arXiv preprint arXiv:2509.03494},
year = {2025}
}