OmniQuality-R:通过全方位质量评估推动奖励模型的进步
计算机视觉与模式识别
2025-10-14 v1
摘要
当前的视觉评估方法通常受限于单一任务。为此,我们提出OmniQuality-R,一个统一的奖励建模框架,将多任务质量推理转化为用于策略优化的连续且可解释的奖励信号。灵感来自主观实验,参与者在评估前被赋予针对不同任务的具体指导,阐明不同的评估原则。我们提出OmniQuality-R,一种结构化的奖励建模框架,将多维推理转化为连续且可解释的奖励信号。为实现这一点,我们通过拒绝抽样获取信息丰富的计划-推理轨迹,构建了一个可靠的链式思维(CoT)数据集,用于监督式微调(SFT)。随后,我们应用Group Relative Policy Optimization(GRPO)进行后训练,使用基于高斯分布的奖励以支持连续评分预测。为进一步稳定训练并提高下游泛化,我们在强化学习期间引入标准差(STD)过滤和熵门控机制。这些技术抑制不稳定的更新,减少策略优化中的方差。我们在三个关键图像质量评估(IQA)任务上评估了OmniQuality-R:审美质量评估、技术质量评估和文本-图像对齐。
引用
@article{arxiv.2510.10609,
title = {OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment},
author = {Yiting Lu and Fengbin Guan and Yixin Gao and Yan Zhong and Xinge Peng and Jiakang Yuan and Yihao Liu and Bo Zhang and Xin Li and Zhibo Chen and Weisi Lin},
journal= {arXiv preprint arXiv:2510.10609},
year = {2025}
}