中文

基于行列式点过程引导的多样化视频生成与策略优化

计算机视觉与模式识别 2025-11-26 v1

摘要

虽然最近的文本到视频(T2V)扩散模型在质量和提示对齐方面取得了令人印象深刻的成果,但它们常常在从单个文本提示抽取多个视频时产生低多样性输出。我们将此挑战表述为集合级别的策略优化问题,旨在训练一个能够覆盖给定提示可行结果中多样化范围的策略。为此,我们引入 DPP-GRPO,一个用于多样化视频生成的新型框架,将行列式点过程(DPP)和群体相对策略优化(GRPO)理论结合,以对多样化生成施加显式奖励。我们的目标通过对冗余样本实施递减报酬(通过 DPP)来将多样性转化为显式信号,同时通过 GRPO 为候选集提供群体反馈。我们的框架是即插即用的,且与模型无关,鼓励跨视觉外观、摄像机运动和场景结构的多样化生成,而不牺牲提示忠实性或感知质量。我们在 WAN 和 CogVideoX 上实现了该方法,并在 VBench、VideoScore 和人类偏好研究等最先进的基准上显示,我们的方法在视频多样性方面 consistently 获益。此外,我们发布了代码和一个包含 30,000 个多样化提示的新基准数据集,以支持未来的研究。

关键词

引用

@article{arxiv.2511.20647,
  title  = {Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization},
  author = {Tahira Kazimi and Connor Dunlop and Pinar Yanardag},
  journal= {arXiv preprint arXiv:2511.20647},
  year   = {2025}
}

备注

Project webpage: https://diverse-video.github.io/