中文

CPA:基于相机姿态感知的扩散变换器用于视频生成

计算机视觉与模式识别 2024-12-03 v1

摘要

尽管扩散变换器(DiT)基于的方法在视频生成方面取得了显著进展,但仍存在可控相机姿态视角的差距。现有方法如 OpenSora 不严格遵循预期轨迹和物理交互,从而限制了下游应用的灵活性。为缓解此问题,本文引入 CPA,一种统一的相机姿态感知文本到视频生成方法,详尽阐述相机运动并整合文本、视觉和空间条件。具体而言,我们部署稀疏运动编码(SME)模块将相机姿态信息转化为时空嵌入,并激活时空注意力注入(TAI)模块将运动图块注入每个 ST-DiT 块。我们的插件架构容纳原始 DiT 参数,支持多种相机姿态和灵活的对象运动。大量定性和定量实验表明,该方法在轨迹一致性和对象一致性方面优于基于 LDM 的方法,适用于长视频生成。

关键词

引用

@article{arxiv.2412.01429,
  title  = {CPA: Camera-pose-awareness Diffusion Transformer for Video Generation},
  author = {Yuelei Wang and Jian Zhang and Pengtao Jiang and Hao Zhang and Jinwei Chen and Bo Li},
  journal= {arXiv preprint arXiv:2412.01429},
  year   = {2024}
}