中文

QualiRAG:用于视觉质量理解的检索增强生成

计算机视觉与模式识别 2026-01-27 v1

摘要

视觉质量评估(VQA)正日益从标量分数预测转向可解释的质量理解——这一范式需要细粒度的时空感知和辅助上下文信息。当前方法依赖于在精选指令数据集上进行监督微调或强化学习,这涉及耗费人力的标注且容易产生特定数据集的偏差。为了应对这些挑战,我们提出了 QualiRAG,一个无训练的检索增强生成(RAG)框架,系统性地利用大型多模态模型(LMMs)的潜在感知知识进行视觉质量感知。与从静态语料库中进行检索的传统 RAG 不同,QualiRAG 通过将问题分解为结构化请求并构建四个互补的知识源:视觉元数据、目标定位、全局质量摘要和局部质量描述,动态生成辅助知识,随后进行感知相关性检索以实现基于证据的推理。大量实验表明,QualiRAG 在视觉质量理解任务上取得了优于开源通用 LMMs 和 VQA 微调 LMMs 的显著提升,并在视觉质量比较任务中表现出竞争力,证明了其在无需任何特定任务训练的情况下具备稳健的质量评估能力。代码将公开于 https://github.com/clh124/QualiRAG。

关键词

引用

@article{arxiv.2601.18195,
  title  = {QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding},
  author = {Linhan Cao and Wei Sun and Weixia Zhang and Xiangyang Zhu and Kaiwei Zhang and Jun Jia and Dandan Zhu and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2601.18195},
  year   = {2026}
}