DiffusionAtlas:高保真一致性扩散视频编辑
计算机视觉与模式识别
2023-12-08 v1
摘要
我们提出了一种基于扩散的视频编辑框架,即 DiffusionAtlas,它能够在编辑视频对象外观时同时实现帧一致性和高保真度。尽管在图像编辑方面取得了成功,但由于在跨帧保持对象外观的时空一致性方面存在挑战,扩散模型在视频编辑方面仍面临重大障碍。另一方面,基于图集的技术允许将分层表示上的编辑一致地传播回帧中。然而,由于在固定 UV 映射场上编辑纹理图集的局限性,它们通常难以创建正确遵循用户提供的文本或视觉条件的编辑效果。我们的方法利用视觉-文本扩散模型直接在扩散图集上编辑对象,确保跨帧的对象身份连贯。我们设计了具有图集约束的损失项,并构建了预训练的文本驱动扩散模型作为像素级指导,以细化形状失真和纠正纹理偏差。定性和定量实验表明,我们的方法在实现一致的高保真视频对象编辑方面优于现有方法。
引用
@article{arxiv.2312.03772,
title = {DiffusionAtlas: High-Fidelity Consistent Diffusion Video Editing},
author = {Shao-Yu Chang and Hwann-Tzong Chen and Tyng-Luh Liu},
journal= {arXiv preprint arXiv:2312.03772},
year = {2023}
}
备注
Preprint