中文

GT-SVJ:面向高效视频奖励建模的生成-变换自监督视频裁决器

计算机视觉与模式识别 2026-05-25 v2

摘要

将视频生成模型与人类偏好对齐仍具有挑战性:当前方法依赖视觉语言模型(VLM)进行奖励建模,但这些模型难以捕捉细微的时序动态。我们提出一种根本不同的方法:复用本构时序结构建模的视频生成模型作为奖励模型。我们提出了基于生成-变换自监督的视频裁决器(\modelname),这是一种新颖的评估模型,将最先进的视频生成模型转化为强大的时序感知奖励模型。我们的关键洞察是,生成模型可被重构为能量基模型(EBM),后者在高质量视频上赋予低能量,在退化视频上赋予高能量,从而在通过对比目标训练时能够精准判别视频质量。为防止模型利用真实视频与生成视频之间的表面差异, 我们设计了通过受控潜在空间扰动生成的具有挑战性的负面视频:包括时序切片、特征交换和帧序乱序,这些扰动模拟了真实但细微的视觉退化。这迫使模型学习有意义的时空特征而非平凡的伪影。\modelname 在 GenAI-Bench 和 MonteBench 上实现了最先进的性能,仅需 30K 人类标注:比现有基于 VLM 的方法少了 6×6\times65×65\times

关键词

引用

@article{arxiv.2602.05202,
  title  = {GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling},
  author = {Shivanshu Shekhar and Uttaran Bhattacharya and Raghavendra Addanki and Mehrab Tanjim and Somdeb Sarkhel and Tong Zhang},
  journal= {arXiv preprint arXiv:2602.05202},
  year   = {2026}
}