VisualQuality-R1: 基于排序强化学习的推理诱导图像质量评估
计算机视觉与模式识别
2025-10-22 v2
摘要
DeepSeek-R1 已证明通过强化学习在激发大型语言模型 (LLM) 的推理和泛化能力方面具有显著有效性。然而,在图像质量评估 (IQA) 这一严重依赖视觉推理的任务中,推理诱导计算的潜力尚未得到充分探索。在本文中,我们引入了 VisualQuality-R1,一个推理诱导的无参考 IQA (NR-IQA) 模型,并使用排序强化学习对其进行训练,这是一种为视觉质量固有的相对性量身定制的学习算法。具体而言,对于一对图像,我们采用组相对策略优化为每张图像生成多个质量分数。这些估计值用于在 Thurstone 模型下计算一张图像质量高于另一张的比较概率。每个质量估计的奖励使用连续保真度度量而非离散二元标签来定义。大量实验表明,所提出的 VisualQuality-R1 持续优于基于判别式深度学习的 NR-IQA 模型以及近期的一种推理诱导质量回归方法。此外,VisualQuality-R1 能够生成上下文丰富、与人类对齐的质量描述,并支持多数据集训练而无需进行感知尺度重对齐。这些特性使得 VisualQuality-R1 特别适合在超分辨率和图像生成等广泛的图像处理任务中可靠地衡量进展。
引用
@article{arxiv.2505.14460,
title = {VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank},
author = {Tianhe Wu and Jian Zou and Jie Liang and Lei Zhang and Kede Ma},
journal= {arXiv preprint arXiv:2505.14460},
year = {2025}
}