中文

解耦推理与评分:视频奖励模型的思考后评分范式

计算机视觉与模式识别 2026-05-13 v2

摘要

近期生成式视频模型的进展日益依赖后训练和推理时放大,二者均严重依赖视频奖励模型 (RM) 的质量。理想的奖励模型应在多样场景下预测准确的奖励值,与人类偏好保持一致。然而,现有范式面临根本性困境:鲁棒 RM 直接对多模态大语言模型 (MLLM) 提取的特征进行回归,缺乏显式推理,易陷入捷径学习,严重依赖大规模数据以实现泛化;而带有链式思考 (CoT) 推理的生成式 RM 虽具备更好的可解释性和泛化潜力,却因推理与评分耦合于单一自回归推理链而遭遇内在优化瓶颈。为兼具 CoT 推理的泛化优势又规避耦合推理评分的训练不稳定性,我们引入 DeScore,一个高效且具可泛化性的视频奖励模型。DeScore 采用解耦的“思考后评分”范式:首先由 MLLM 生成显式 CoT,然后通过包含可学习查询标记和回归头的专用判别性评分模块预测最终奖励。DeScore 通过两阶段框架优化:(1) 包含随机掩码机制的判别性 cold start,确保评分能力的稳健性;(2) 双目标强化学习阶段,独立细化 CoT 推理质量并校准最终奖励,确保更高质量的推理直接转化为更佳模型性能。

关键词

引用

@article{arxiv.2605.05922,
  title  = {Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling},
  author = {Yuan Wang and Ouxiang Li and Yulong Xu and Borui Liao and Jiajun Liang and Jinghan Li and Meng Wang and Xintao Wang and Pengfei Wan and Kuien Liu and Xiang Wang},
  journal= {arXiv preprint arXiv:2605.05922},
  year   = {2026}
}