中文

基于可靠区域感知推理的图像质量评估模型 Zoom-IQA

计算机视觉与模式识别 2026-01-16 v2

摘要

图像质量评估(IQA)是计算机视觉中的一个长期存在的问题。以往方法通常专注于预测数值分数而不提供解释,或提供低层描述而缺乏精确分数。近期的基于推理的视觉语言模型(VLM)在 IQA 中通过联合生成质量描述和分数显示出强大的潜力。然而,现有的 VLM-based IQA 方法常因整合视觉和文本线索能力有限,导致推理不可靠。本文引入 Zoom-IQA,一个 VLM-based IQA 模型,显式模拟关键认知行为:不确定性意识、区域推理和迭代细化。具体而言,我们提出两个阶段的训练 pipeline:1)在我们构建的 Grounded-Rationale-IQA(GR-IQA)数据集上进行监督微调(SFT),教导模型在关键区域中 grounding 其评估;2)采用强化学习(RL)进行动态策略探索,通过我们的 KL-Coverage 正则化器防止推理和评分多样性崩溃,并引入渐进式重抽样策略以缓解标注偏差。广泛的实验表明,Zoom-IQA 在鲁棒性、可解释性和泛化能力方面取得改进。将其应用于下游任务,如图像修复,进一步证明了 Zoom-IQA 的有效性。

关键词

引用

@article{arxiv.2601.02918,
  title  = {Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning},
  author = {Guoqiang Liang and Jianyi Wang and Zhonghua Wu and Shangchen Zhou},
  journal= {arXiv preprint arXiv:2601.02918},
  year   = {2026}
}

备注

Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage