中文

DeCo:解耦以人为中心的扩散视频编辑与运动一致性

计算机视觉与模式识别 2024-08-15 v1

摘要

扩散模型开启了视频编辑的新纪元,可通过文本提示灵活操控视频内容。尽管以人为中心的视频编辑有着广泛的应用需求,但这些模型在处理人类等复杂对象时面临重大挑战。在本文中,我们引入了DeCo,一个专门设计的视频编辑框架,将人类与背景作为独立的可编辑目标进行处理,通过保持各组成成分的连贯性来确保全局时空一致性。具体而言,我们提出了一种解耦的动态人体表示,利用参数化人体先验来生成定制化人类,同时保持与原始视频一致的运动。此外,我们将背景视为分层图集,在其上应用文本引导的图像编辑方法。为进一步优化过程中增强人类的几何与纹理,我们将得分蒸馏采样计算扩展到法线空间和图像空间。此外,我们利用光照感知视频和谐器解决了编辑目标之间光照不一致的问题,这是分解-编辑-组合方法中此前被忽视的问题。广泛的定性和定量实验表明,DeCo在以人为中心的视频中优于先前的视频编辑方法,尤其是在长视频中表现突出。

关键词

引用

@article{arxiv.2408.07481,
  title  = {DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion Consistency},
  author = {Xiaojing Zhong and Xinyi Huang and Xiaofeng Yang and Guosheng Lin and Qingyao Wu},
  journal= {arXiv preprint arXiv:2408.07481},
  year   = {2024}
}

备注

European Conference on Computer Vision