缓解感知偏差:增强 LMM 用于图像质量评估的免训练方法
计算机视觉与模式识别
2025-11-14 v2 图像与视频处理
摘要
尽管大型多模态模型 (LMM) 在高级视觉任务中表现出色,其在图像质量评估 (IQA) 方面的能力仍然有限。一个主要原因是 LMM 主要针对高级任务(如图像描述)进行训练,强调在不同质量下提取统一的图像语义。这种语义感知但对质量不敏感的感知偏差,不可避免地导致这些 LMM 在被迫进行质量评级时严重依赖图像语义。在本文中,我们不选择代价高昂的重新训练或微调 LMM,而是提出一个免训练去偏框架,其中通过缓解由图像语义引起的偏差来修正图像质量预测。具体而言,我们首先探索了几种语义保持失真,它们能在保持语义可识别的同时显著降低图像质量。通过将这些特定失真应用于查询或测试图像,我们确保退化图像被识别为低质量,同时其语义基本保留。在质量推理期间,查询图像及其对应的退化版本连同提示一起输入 LMM,提示表明查询图像的质量应在退化图像被视为低质量的条件下进行推断。这种先验条件有效对齐了 LMM 的质量感知,因为所有退化图像均被一致评为低质量,而无论其语义差异如何。最后,使用条件概率模型聚合在不同先验条件(退化版本)下推断的查询图像质量分数。在各种 IQA 数据集上的大量实验表明,我们的去偏框架能持续增强 LMM 性能。
引用
@article{arxiv.2411.12791,
title = {Mitigating Perception Bias: A Training-Free Approach to Enhance LMM for Image Quality Assessment},
author = {Baoliang Chen and Siyi Pan and Dongxu Wu and Liang Xie and Xiangjie Sui and Lingyu Zhu and Hanwei Zhu},
journal= {arXiv preprint arXiv:2411.12791},
year = {2025}
}