中文

面向视频外推的分层掩码三维扩散模型

计算机视觉与模式识别 2024-01-22 v3

摘要

视频外推旨在充分补全视频帧边缘的缺失区域。与图像外推相比,它带来额外挑战,因为模型应保持填充区域的时序一致性。本文中,我们引入一种用于视频外推的掩码三维扩散模型。我们利用掩码建模技术训练该三维扩散模型。这使我们能够使用多帧引导帧连接多个视频片段推理的结果,从而确保时序一致性并减少相邻帧间的抖动。同时,我们提取视频的全局帧作为提示,并通过交叉注意力引导模型获取当前视频片段之外的信息。我们还引入一种混合由粗到细推理流程以缓解伪影累积问题。现有的由粗到细流程仅使用填充策略,由于稀疏帧时间间隔过大而带来退化。我们的流程受益于掩码建模的双向学习,因此在生成稀疏帧时可采用填充与插值的混合策略。实验表明,我们的方法在视频外推任务中取得了最先进的(SOTA)结果。更多结果与代码见 https://fanfanda.github.io/M3DDM/。

关键词

引用

@article{arxiv.2309.02119,
  title  = {Hierarchical Masked 3D Diffusion Model for Video Outpainting},
  author = {Fanda Fan and Chaoxu Guo and Litong Gong and Biao Wang and Tiezheng Ge and Yuning Jiang and Chunjie Luo and Jianfeng Zhan},
  journal= {arXiv preprint arXiv:2309.02119},
  year   = {2024}
}

备注

Accepted to ACM MM 2023