DEVIS-GRPO: 在动态极端视角合成中 unleash GRPO
计算机视觉与模式识别
2026-05-19 v1
摘要
轨迹控制视频生成已成为可控视频生成的关键技术。虽然当前方法在小幅度相机运动下表现良好, 但在大幅度运动时性能显著下降。现有的极端视角合成方法通常需要专门的视频配对, 且标注成本高昂。为此, 我们提出了基于 GRPO 的 Dynamic Extreme View Synthesis-GRPO (DEVIS-GRPO), 这是一种极端视角视频生成的首个在线策略梯度方法。我们方法的核心是一种新颖的采样策略: Accumulative Dynamic Extreme View Synthesis (ADEVIS), 通过逐步累积小幅度运动来实现大幅度相机运动。该方法带来了两个关键优势: 1) 提升训练效率, 因为无需通过收集昂贵的大幅度视频配对来预热策略模型; 2) 增加采样多样性, 通过灵活变更轨迹配置实现。最后, 我们设计了多层次一致性-质量奖励函数以筛选模型优化的高质量样本。在 Kubric-4D, iPhone 和 DL3DV 数据集上的实验表明, 我们方法的优势显著。 在 Kubric-4D 上, 相对于第二名方法, 在非遮挡区域的 PSNR 提升了 21.57%, SSIM 提升了 7.31%。在 iPhone 上, LPIPS 降低了 18.56%。
引用
@article{arxiv.2605.16937,
title = {DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis},
author = {Yi Zuo and Huimin Wu and Lingling Li and Fang Liu and Licheng Jiao and Qing Li},
journal= {arXiv preprint arXiv:2605.16937},
year = {2026}
}