ViDA-UGC:基于视觉失真评估的用户生成内容图像质量分析
计算机视觉与模式识别
2025-08-19 v1
摘要
最近的多模态大型语言模型 (MLLM) 引入了从不可解释的图像质量评分转向可解释图像质量评估 (IQA) 的范式,展示出实际应用潜力,如质量控制和优化指导。然而,当前的可解释 IQA 方法不仅不充分地使用相同的失真标准来评估用户生成内容 (UGC) 和 AI 生成内容 (AIGC) 图像,还缺乏对监控图像质量和指导图像修复的详细质量分析。本研究建立了首个大规模视觉失真评估指令调优数据集,用于 UGC 图像,称为 ViDA-UGC,包含 1.1 万张具备细粒度质量 grounding、详细质量感知和推理质量描述数据。该数据集通过失导向管道构建,涉及人类主观标注和链式思考 (CoT) 评估框架。该框架引导 GPT-4o 通过识别和分析 UGC 失真,生成质量描述,从而帮助捕获与失导模式内在相关的丰富低层视觉特征。此外,我们精选 476 张图像,对应 6,149 个问答对,邀请专业团队确保 GPT 生成信息的准确性和质量。精选并修订后的数据进一步贡献于首个 UGC 失导评估基准,称为 ViDA-UGC-Bench。实验结果表明,ViDA-UGC 和 CoT 框架在 ViDA-UGC-Bench 和 Q-Bench 上,能够持续提升各种基础 MLLM 的各种图像质量分析能力,甚至超越 GPT-4o。
引用
@article{arxiv.2508.12605,
title = {ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images},
author = {Wenjie Liao and Jieyu Yuan and Yifang Xu and Chunle Guo and Zilong Zhang and Jihong Li and Jiachen Fu and Haotian Fan and Tao Li and Junhui Cui and Chongyi Li},
journal= {arXiv preprint arXiv:2508.12605},
year = {2025}
}