JOG3R:面向 3D 一致性视频生成器的探索
计算机视觉与模式识别
2025-03-28 v2 人工智能
摘要
图像生成器的涌现能力已导致许多具有影响力的零样本或少样本应用。ederated by this success, 我们调查视频生成器是否同样表现出 3D 感知能力。以结构从运动作为 3D 感知任务, 我们测试视频生成器的中间特征(本文中使用 OpenSora)是否支持相机姿态估计。意外的是, 最初我们仅发现两者之间存在微弱的相关性。更深入的调查揭示, 尽管视频生成器产生符合情境的视频帧, 但这些帧本身并非真正 3D 一致。相反, 我们提出联合训练两个任务, 使用光度生成和 3D 感知误差。具体而言, 我们发现最先进的视频生成和相机姿态估计(即 DUSt3R [79])网络共享常见结构, 并提出一种统一架构。所提出的统一模型称为 \nameMethod, 能够在生成 3D 一致视频的同时, 产出具有竞争力质量的相机姿态估计。总之, 我们提出了首个实现 3D 一致性、能够生成逼真视频帧且可被重新用于其他 3D 感知任务的统一视频生成器。
引用
@article{arxiv.2501.01409,
title = {JOG3R: Towards 3D-Consistent Video Generators},
author = {Chun-Hao Paul Huang and Niloy Mitra and Hyeonho Jeong and Jae Shin Yoon and Duygu Ceylan},
journal= {arXiv preprint arXiv:2501.01409},
year = {2025}
}