中文

下一个词元即足够:基于多模态大语言模型的真实图像质量与美学评分

计算机视觉与模式识别 2025-03-11 v1

摘要

移动互联网的快速扩张导致用户生成内容(UGC)图像大幅增加,因此对 UGC 图像进行全面评估变得既紧迫又必要。最近,多模态大语言模型(MLLM)在图像质量评估(IQA)和图像美学评估(IAA)中展现出了巨大潜力。尽管取得了这些进展,但有效地对 UGC 图像的质量和美学进行评分仍面临两大主要挑战:1)单一分数不足以捕捉层次化的人类感知。2)如何使用 MLLM 输出数值分数(例如平均主观评分,MOS)仍是一个悬而未决的问题。为了应对这些挑战,我们引入了一个名为 RealQA(Realistic image Quality and Aesthetic)的新数据集,包含 14,715 张 UGC 图像,每张图像均标注有 10 个细粒度属性。这些属性跨越三个层次:低层(例如图像清晰度)、中层(例如主体完整性)和高层(例如构图)。此外,我们针对如何使用 MLLM 有效预测数值分数进行了一系列深入全面的调查。令人惊讶的是,仅通过预测两个额外的有效数字,下一个词元范式即可达到 SOTA 性能。此外,借助思维链(CoT)结合学习到的细粒度属性,所提出的方法在五个用于 IQA 和 IAA 的公共数据集上优于 SOTA 方法,具有卓越的可解释性,并在视频质量评估(VQA)中表现出强大的零样本泛化能力。代码和数据集将予发布。

关键词

引用

@article{arxiv.2503.06141,
  title  = {Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model},
  author = {Mingxing Li and Rui Wang and Lei Sun and Yancheng Bai and Xiangxiang Chu},
  journal= {arXiv preprint arXiv:2503.06141},
  year   = {2025}
}