通过检索增强生成提升大型多模态模型图像质量评估能力
计算机视觉与模式识别
2026-01-14 v1 人工智能
摘要
大型多模态模型 (LMM) 近期在低层视觉感知任务中展现出巨大潜力,尤其是在图像质量评估 (IQA) 中表现出强大的零样性能力。然而,实现最先进的性能通常需要计算密集型的微调方法,这些方法旨在对齐输出中与质量相关的标记与图像质量水平的分布。灵感来源于最近针对 LMM 的无训练工作,我们引入了 IQARAG,这是一个新颖的、无训练的框架,用于提升 LMM 的 IQA 能力。IQARAG 利用检索增强生成 (RAG) 从输入图像中检索出一些语义相似但质量不同的参考图像及其对应的平均意见分数 (MOS)。这些检索到的图像和输入图像被整合到特定的提示中。检索到的图像为 LMM 提供了 IQA 任务的视觉感知锚点。IQARAG 包含三个关键阶段:检索特征提取、图像检索和集成与质量得分生成。在包括 KADID、KonIQ、LIVE Challenge 和 SPAQ 在内的多个多样化 IQA 数据集上进行的大规模实验表明,提出的 IQARAG 有效地提升了 LMM 的 IQA 性能,为质量评估提供了一种资源高效的微调替代方案。
引用
@article{arxiv.2601.08311,
title = {Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation},
author = {Kang Fu and Huiyu Duan and Zicheng Zhang and Yucheng Zhu and Jun Zhao and Xiongkuo Min and Jia Wang and Guangtao Zhai},
journal= {arXiv preprint arXiv:2601.08311},
year = {2026}
}