中文

使用评分分布教育大型语言模型进行精确图像质量评分回归

计算机视觉与模式识别 2025-12-01 v3

摘要

随着多模态大型语言模型(Multi-modal Large Language Models, MLLMs)的快速发展,基于 MLLM 的图像质量评估(IQA)方法在语言质量描述方面显示出前景。然而,当前方法在图像质量评分方面仍显不足。本文旨在利用 MLLM 进行精确的质量评分回归。一个关键挑战是质量评分本质上是连续的,通常建模为高斯分布,而 MLLM 生成的是离散的 token 输出。这一不匹配导致了评分离散化。以往方法将平均评分离散化为 one-hot 标签,导致信息损失,无法捕捉图像之间的关系。我们提出一种基于分布的方法,将评分分布离散化为软标签。该方法保留了评分分布的特征,实现了高精度,同时保持了图像之间的关系。此外,为了解决数据集差异——不同 IQA 数据集呈现出各种分布——我们引入基于泰勒斯特模型的保真度损失。该损失捕捉了数据集内的关系,促进了跨多个 IQA 数据集的联合训练。通过这些设计,我们开发了用于评分回归的描绘图像质量评估模型(DeQA-Score)。实验表明,DeQA-Score 在多个基准测试中稳定优于基线方法。此外,DeQA-Score 能够预测与人类注释高度一致的评分分布。代码和模型权重已在 https://depictqa.github.io/deqa-score/ 上发布。

关键词

引用

@article{arxiv.2501.11561,
  title  = {Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution},
  author = {Zhiyuan You and Xin Cai and Jinjin Gu and Tianfan Xue and Chao Dong},
  journal= {arXiv preprint arXiv:2501.11561},
  year   = {2025}
}

备注

Accepted by CVPR 2025