构建视觉语言模型在盲目图像质量评估中的合理推理
计算机视觉与模式识别
2025-12-11 v1
摘要
近期BIQA领域的进展由VLMs推动,其语义推理能力表明它们可能提取视觉特征、生成描述性文本并以类人方式推断质量。然而,这些模型常常产生与最终质量预测相矛盾的文本描述,且预测得分在推理过程中不稳定——这些行为不符合人类推理。为了理解这些问题,我们分析了导致矛盾评估和不稳定性的因素。我们首先估计最终质量预测与生成视觉特征之间的关系,发现预测并未完全基于特征,且两者之间的逻辑联系较弱。此外,解码中间VLM层表明,该模型经常依赖有限的候选 token 集合,这有助于预测不稳定。为了鼓励更符合人类推理的方式,我们引入了两种阶段的调优方法,显式地将视觉感知与质量推断分离。在第一个阶段,模型学习视觉特征;在第二个阶段,它仅从这些特征推断质量。在SPAQ和KONIQ上的实验表明,我们的方法将预测不稳定性从22.00%降低到12.39%,并在LIVE、CSIQ、SPAQ和KONIQ上实现SRCC/PLCC平均提升0.3124/0.3507。进一步分析显示,我们的方法提高了推理过程的稳定性和可靠性。
引用
@article{arxiv.2512.09555,
title = {Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment},
author = {Yuan Li and Zitang Sun and Yen-ju Chen and Shin'ya Nishida},
journal= {arXiv preprint arXiv:2512.09555},
year = {2025}
}
备注
Accepted to the ICONIP (International Conference on Neural Information Processing), 2025