超越分数的描绘:通过多模态语言模型推进图像质量评价
计算机视觉与模式识别
2024-07-16 v3
摘要
我们引入了一种描绘式图像质量评价方法(DepictQA),克服了传统基于分数方法的局限性。DepictQA 利用多模态大语言模型(MLLM),实现对图像质量的详细、基于语言的、类人评价。不同于依赖分数的传统图像质量评价(IQA)方法,DepictQA 以描述性和比较性的方式解释图像内容和失真,与人类的推理过程紧密对齐。为了构建 DepictQA 模型,我们建立了一个层次化的任务框架,并收集了一个多模态 IQA 训练数据集。为了应对训练数据有限和多图像处理的挑战,我们提出使用多源训练数据和专门的图像标签。这些设计使得 DepictQA 在多个基准上的表现优于基于分数的方法。此外,与通用 MLLM 相比,DepictQA 能够生成更准确的推理描述性语言。我们还展示了我们的全参考数据集可以扩展到无参考应用。这些结果展示了多模态 IQA 方法的研究潜力。代码和数据集可在 https://depictqa.github.io 获取。
引用
@article{arxiv.2312.08962,
title = {Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language Models},
author = {Zhiyuan You and Zheyuan Li and Jinjin Gu and Zhenfei Yin and Tianfan Xue and Chao Dong},
journal= {arXiv preprint arXiv:2312.08962},
year = {2024}
}
备注
Accepted to ECCV2024, Camera Ready Version