基于大规模多模态数据集提升描述性图像质量评估
计算机视觉与模式识别
2025-12-01 v3
摘要
随着视觉语言模型(VLMs)的快速发展,基于VLM的图像质量评估(IQA)寻求以语言方式描述图像质量,以与人类表达一致并捕捉IQA任务的多维特性。然而,现有方法距离实际应用仍有距离。首先,先前工作仅聚焦于特定子任务或情境,无法与多样化的实际应用场景相吻合。其次,由于数据覆盖范围、规模和质量的局限,其性能仍不理想。为克服这些挑战,我们引入了增强型描绘图像质量评估模型(DepictQA-Wild)。本方法包括一种多功能IQA任务范式,涵盖评估与比较任务、简要与详细响应、全参考与非参考情境。我们引入基于真实答案的dataset construction方法以提升数据质量,并将dataset规模扩展至495K,构建于简要-详细联合框架下。因此,我们构建了一个全面、大规模且高质量的dataset,称为DQ-495K。我们在训练时保留图像分辨率,以更好地处理与分辨率相关的质量问题,并估计置信度得分,以帮助过滤低质量响应。实验结果表明,DepictQA-Wild显著优于传统基于评分的方法、先前基于VLM的IQA模型以及专有GPT-4V,在畸变识别、即时评估和推理任务中表现更佳。我们的优势通过实际应用进一步得到验证,包括评估网络下载图像和排序模型处理后的图像。代码、dataset和模型权重已发布于https://depictqa.github.io/。
引用
@article{arxiv.2405.18842,
title = {Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset},
author = {Zhiyuan You and Jinjin Gu and Xin Cai and Zheyuan Li and Kaiwen Zhu and Chao Dong and Tianfan Xue},
journal= {arXiv preprint arXiv:2405.18842},
year = {2025}
}
备注
Accepted by TIP