LLaVA-Critic-R1:您的批评模型实际上是个强大的策略模型
音频与语音处理
2025-09-03 v1
摘要
在视觉语言建模中,批评模型通常被训练来评估输出——分配标量得分或两两偏好——而不是生成响应。这种与策略模型(即产生响应的模型)的分离是如此根深蒂固,以致批评模型几乎不被考虑用于直接策略用途。本文我们挑战了这一惯例。我们将偏好标记的批评数据集重新组织为可验证的训练信号,并在基础生成模型上直接进行强化学习,产生LLaVA-Critic-R1——一个在优化偏好判断的同时保留完整生成能力的多模态批评模型。奇怪的是,LLaVA-Critic-R1不仅表现出顶尖的批评能力,而且作为竞争性策略模型——在26个视觉推理和理解基准测试中匹配或超越了在领域内数据上训练的专门推理视觉语言模型(VLM),平均提升了+5.7%。将这种方法扩展到现有强大的推理VLM可得到LLaVA-Critic-R1+,进一步提升策略性能而不牺牲批评质量,在7B规模上实现了71.9的SoTA性能。最后,我们表明增强的批评能力有益于推理:在测试时应用自我批评可在五个代表性推理任务上平均提升+13.8%。我们的结果揭示了在批评数据上进行RL训练可产生同时在评估和生成中卓越的统一模型,为通往可扩展、自我改进的多模态系统提供了简单路径。
引用
@article{arxiv.2509.00675,
title = {Speaker-Conditioned Phrase Break Prediction for Text-to-Speech with Phoneme-Level Pre-trained Language Model},
author = {Dong Yang and Yuki Saito and Takaaki Saeki and Tomoki Koriyama and Wataru Nakata and Detai Xin and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2509.00675},
year = {2025}
}
备注
Under Review