Q-Ponder:面向基于推理的视觉质量评估的统一训练管线
计算机视觉与模式识别
2025-06-13 v2 人工智能
多媒体
摘要
近期研究表明,多模态大语言模型 (MLLM) 能够通过可解释的评估表现优异地评估视觉质量。然而,现有方法通常将质量评分和推理描述视为独立任务,优化目标相互矛盾,导致权衡:擅长推理描述的模型在精确评分方面不足,而以评分为导向的模型则缺乏可解释性。此限制阻碍了 MLLM 在视觉质量评估中的潜力,因为准确性与可解释性应相互促进。为此,我们提出统一的两阶段训练框架,包括 cold-start 阶段和基于强化学习的微调阶段。具体而言,在第一阶段,我们通过专家设计的提示词从教师模型蒸馏高质量数据,通过交叉熵损失监督初始化推理能力。在第二阶段,我们引入基于组相对策略优化 (GRPO) 的新型奖励,联合优化评分准确性和推理一致性。我们将由这两个阶段衍生的模型分别称为 Q-Ponder-CI 和 Q-Ponder。大量实验表明,Q-Ponder 在质量评分回归基准测试中实现了领先 (SOTA) 水平,在跨域数据集上 SRCC 提升最高可达 6.5%。此外,Q-Ponder 在描述式 SOTA 模型中显著优于其教师模型 Qwen-2.5-VL-72B,尤其在描述准确性和合理性方面,显示出在多样任务上的泛化潜力。
引用
@article{arxiv.2506.05384,
title = {Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment},
author = {Zhuoxuan Cai and Jian Zhang and Xinbin Yuan and Peng-Tao Jiang and Wenxiang Chen and Bowen Tang and Lujian Yao and Qiyuan Wang and Jinwen Chen and Bo Li},
journal= {arXiv preprint arXiv:2506.05384},
year = {2025}
}