中文

重访基于 MLLM 的图像质量评估:误差及其补救

计算机视觉与模式识别 2025-11-12 v1

摘要

多模态大语言模型 (MLLM) 的快速发展推动了图像质量评估 (IQA) 任务的发展。然而,一个关键挑战源于 MLLM 的离散 token 输出与 IQA 任务所需连续质量评分之间的内在不匹配。这一差异显著阻碍了基于 MLLM 的 IQA 方法性能。将离散 token 预测转换为连续评分的先前方法常受转换误差的制约。此外,水平 token(如 "good")引入的语义混淆进一步限制了 MLLM 在 IQA 任务上的表现,并降低其相关任务的原始能力。为解决这些问题,我们对先前方法固有的误差进行了理论分析,并在此基础上提出了一种简单而有效的框架 Q-Scorer。该框架纳入轻量级回归模块和 IQA 特定评分 token 以整合到 MLLM 流程中。广泛实验表明,Q-Scorer 在多个 IQA 数据集上实现了最先进的性能,能够良好地泛化到混合数据集,并在与其他方法结合时进一步提升性能。

关键词

引用

@article{arxiv.2511.07812,
  title  = {Revisiting MLLM Based Image Quality Assessment: Errors and Remedy},
  author = {Zhenchen Tang and Songlin Yang and Bo Peng and Zichuan Wang and Jing Dong},
  journal= {arXiv preprint arXiv:2511.07812},
  year   = {2025}
}

备注

13 pages