通过训练大型多模态模型进行比较的自适应图像质量评估
计算机视觉与模式识别
2024-05-30 v1 图像与视频处理
摘要
尽管大型多模态模型(LMM)在依赖绝对质量评级的图像质量评估(IQA)方面取得了显著进展,但如何将可靠的相对质量比较输出转换为连续的感知质量分数仍基本未被探索。为填补这一空白,我们引入了Compare2Score——一种基于LMM的全方位无参考IQA(NR-IQA)模型,它能够产生定性比较响应,并有效地将这些离散比较级别转换为连续质量分数。具体而言,在训练期间,我们通过比较来自同一IQA数据集的图像来生成规模放大的比较指令,从而更灵活地整合不同IQA数据集。利用建立的大规模训练语料库,我们开发了一个类似人类的视觉质量比较器。在推理期间,超越二元选择,我们提出了一种软比较方法,计算测试图像相对于多个预定义锚点图像被偏好的似然。通过最大后验估计与所得概率矩阵进一步优化质量分数。在九个IQA数据集上的大量实验验证了Compare2Score有效地将训练期间文本定义的比较级别与推理时转换的单个图像质量分数联系起来,在多种场景下超越了最先进的IQA模型。此外,我们验证了基于概率矩阵的推理转换不仅提高了Compare2Score的评级准确性,也提高了零样本通用LMM的准确性,表明其内在有效性。
引用
@article{arxiv.2405.19298,
title = {Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare},
author = {Hanwei Zhu and Haoning Wu and Yixuan Li and Zicheng Zhang and Baoliang Chen and Lingyu Zhu and Yuming Fang and Guangtao Zhai and Weisi Lin and Shiqi Wang},
journal= {arXiv preprint arXiv:2405.19298},
year = {2024}
}