Q-Bench-Portrait:多模态大语言模型在人像图像质量感知上的基准测试
计算机视觉与模式识别
2026-01-27 v1
摘要
多模态大语言模型(MLLM)的最新进展在现有的低层视觉基准上展现了令人印象深刻的性能,这些基准主要关注通用图像。然而,它们感知和评估人像图像的能力——一个以独特的结构和感知特性为特征的领域——在很大程度上仍未被探索。为此,我们引入了 Q-Bench-Portrait,这是第一个专门为人像图像质量感知设计的整体基准,包含 2,765 个图像-问答三元组,并具有以下特点:(1)多样化的人像图像来源,包括自然图像、合成失真图像、AI 生成图像、艺术图像和计算机图形图像;(2)全面的质量维度,涵盖技术失真、AIGC 特有失真和美学;(3)一系列问题格式,包括单选、多选、判断题和开放式问题,涵盖全局和局部层面。基于 Q-Bench-Portrait,我们评估了 20 个开源和 5 个闭源的 MLLM,结果显示,尽管当前模型在人像图像感知方面表现出一定的能力,但其性能仍然有限且不精确,与人类判断存在明显差距。我们希望所提出的基准能够促进对通用和领域特定 MLLM 的人像图像感知能力进行进一步研究。
引用
@article{arxiv.2601.18346,
title = {Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception},
author = {Sijing Wu and Yunhao Li and Zicheng Zhang and Qi Jia and Xinyue Li and Huiyu Duan and Xiongkuo Min and Guangtao Zhai},
journal= {arXiv preprint arXiv:2601.18346},
year = {2026}
}