PreResQ-R1:面向视觉质量评估的细粒度排序-评分强化学习基于偏好-响应解耦策略优化
计算机视觉与模式识别
2025-11-10 v1
摘要
视觉质量评估(QA)旨在预测人类对视觉保真度的人类感知判断。尽管最近的多模态大语言模型(MLLM)在对图像和视频质量进行推理方面显示出前景,但现有方法主要依赖监督微调或仅使用排序目标,导致推理浅薄、得分校准不足以及跨域泛化受限。我们提出了 PreResQ-R1,一种基于偏好-响应解耦的强化学习框架,通过单一的推理驱动优化方案统一绝对得分回归与相对排序一致性。与先前的 QA 方法不同,PreResQ-R1 引入双分支奖励函数,分别建模样本内部响应一致性和样本间偏好对齐,通过基于组相对策略优化(GRPO)进行优化。这种设计鼓励对感知质量进行细粒度、稳定且可解释的链式思考推理。为扩展静态图像之外的应用,我们进一步设计了全局-时间和局部-空间数据流策略用于视频质量评估。惊人地说,在仅对 6K 张图片和 28K 条视频进行强化微调后,PreResQ-R1 在 10 个 IQA 和 5 个 VQA 基准测试中均实现了最先进的结果,分别在 IQA 任务中超越了 5.30% 和文本粗体2.15%。除了定量提升之外,它还产生与人类感知一致的推理痕迹,从而揭示了质量判断背后的感知线索。代码和模型已公开。
引用
@article{arxiv.2511.05393,
title = {PreResQ-R1: Towards Fine-Grained Rank-and-Score Reinforcement Learning for Visual Quality Assessment via Preference-Response Disentangled Policy Optimization},
author = {Zehui Feng and Tian Qiu and Tong Wu and Junxuan Li and Huayuan Xu and Ting Han},
journal= {arXiv preprint arXiv:2511.05393},
year = {2025}
}
备注
27 pages, 14 figures, under review as a conference paper