基于行列式点过程引导的多样化视频生成与策略优化
计算机视觉与模式识别
2025-11-26 v1
摘要
虽然最近的文本到视频(T2V)扩散模型在质量和提示对齐方面取得了令人印象深刻的成果,但它们常常在从单个文本提示抽取多个视频时产生低多样性输出。我们将此挑战表述为集合级别的策略优化问题,旨在训练一个能够覆盖给定提示可行结果中多样化范围的策略。为此,我们引入 DPP-GRPO,一个用于多样化视频生成的新型框架,将行列式点过程(DPP)和群体相对策略优化(GRPO)理论结合,以对多样化生成施加显式奖励。我们的目标通过对冗余样本实施递减报酬(通过 DPP)来将多样性转化为显式信号,同时通过 GRPO 为候选集提供群体反馈。我们的框架是即插即用的,且与模型无关,鼓励跨视觉外观、摄像机运动和场景结构的多样化生成,而不牺牲提示忠实性或感知质量。我们在 WAN 和 CogVideoX 上实现了该方法,并在 VBench、VideoScore 和人类偏好研究等最先进的基准上显示,我们的方法在视频多样性方面 consistently 获益。此外,我们发布了代码和一个包含 30,000 个多样化提示的新基准数据集,以支持未来的研究。
引用
@article{arxiv.2511.20647,
title = {Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization},
author = {Tahira Kazimi and Connor Dunlop and Pinar Yanardag},
journal= {arXiv preprint arXiv:2511.20647},
year = {2025}
}
备注
Project webpage: https://diverse-video.github.io/