CamViG:基于多模态变换器的相机感知图像到视频生成
计算机视觉与模式识别
2024-05-24 v1 人工智能
摘要
我们将多模态变换器扩展到包含3D相机运动作为视频生成任务的调节信号。生成式视频模型正变得越来越强大,因此研究重点集中在控制此类模型输出的方法上。我们提出通过将生成的视频调节为在生成视频过程中三维相机运动的编码,来为生成式视频方法添加虚拟3D相机控制。结果表明,我们(1)能够成功地在视频生成过程中控制相机,从单帧和相机信号开始;(2)我们使用传统计算机视觉方法展示了生成的3D相机路径的准确性。
引用
@article{arxiv.2405.13195,
title = {CamViG: Camera Aware Image-to-Video Generation with Multimodal Transformers},
author = {Andrew Marmon and Grant Schindler and José Lezama and Dan Kondratyuk and Bryan Seybold and Irfan Essa},
journal= {arXiv preprint arXiv:2405.13195},
year = {2024}
}