基于大型多模态模型的图像质量 grounding
计算机视觉与模式识别
2024-07-25 v1
摘要
最近的大型多模态模型(LMM)的进展大大提高了图像质量评估(IQA)方法评估和解释视觉内容质量的能力。然而,这些进展主要集中在整体质量评估,而对细粒度局部质量的详细检查仍 largely 未被探索。本文介绍 Q-Ground,是第一个旨在结合大型多模态模型和详细视觉质量分析以解决细粒度视觉质量 grounding 框架。我们的贡献核心是引入 QGround-100K 数据集,包含 100k 个 (图像、质量文本、失真分割) 三元组,以促进对视觉质量的深入研究。该数据集分为两个部分:一个包含人工标注注释的部分用于准确质量评估,另一个由类似 GPT4V 的 LMM 自动标注,既有助于提高模型训练的鲁棒性,也减少了数据收集成本。有了 QGround-100K 数据集,我们提出一种基于 LMM的方法,采用多尺度特征学习,学习能够基于文本提示执行图像质量问答和失真分割的模型。这种双功能方法不仅细化了模型对区域感知图像质量的理解,还使其能够交互式地响应关于图像质量和特定失真的复杂文本查询。Q-Ground 为更细粒度的视觉质量分析迈出了一步,为该领域的后续研究建立了新的基准。代码和数据集可在 https://github.com/Q-Future/Q-Ground 获取。
引用
@article{arxiv.2407.17035,
title = {Q-Ground: Image Quality Grounding with Large Multi-modality Models},
author = {Chaofeng Chen and Sensen Yang and Haoning Wu and Liang Liao and Zicheng Zhang and Annan Wang and Wenxiu Sun and Qiong Yan and Weisi Lin},
journal= {arXiv preprint arXiv:2407.17035},
year = {2024}
}
备注
ACM Multimedia 2024 (Oral)