中文

人体检测器竟是出人意料的强大奖励模型

计算机视觉与模式识别 2026-01-22 v2

摘要

视频生成模型近期在视觉保真度和时序连贯性上取得了令人瞩目的成果。然而,它们在处理复杂的非刚体运动时仍面临困难,尤其是在合成人类执行体育、舞蹈等动态动作时。生成的视频经常出现肢体缺失或多余、姿态扭曲或物理上不可行的动作。在这项工作中,我们提出了一个极其简单的奖励模型 HuDA,用于量化和改善生成视频中的人体运动。HuDA 融合了用于外观质量的人体检测置信度,以及用于捕捉运动真实感的时序提示对齐分数。我们证明,这个简单的奖励函数利用了现成模型而无需任何额外训练,其性能优于使用人工标注数据微调的专用模型。将 HuDA 用于视频模型的群体奖励策略优化(GRPO)后训练,我们显著提升了视频生成质量,尤其是在生成复杂人体运动时,以 73% 的胜率超越了 Wan 2.1 等最先进模型。最后,我们证明 HuDA 提升的生成质量不仅限于人类,例如,它显著改善了动物视频和人物交互的生成。

关键词

引用

@article{arxiv.2601.14037,
  title  = {Human detectors are surprisingly powerful reward models},
  author = {Kumar Ashutosh and XuDong Wang and Xi Yin and Kristen Grauman and Adam Polyak and Ishan Misra and Rohit Girdhar},
  journal= {arXiv preprint arXiv:2601.14037},
  year   = {2026}
}

备注

Technical report