LVCD: 基于扩散模型的参考线稿视频上色
计算机视觉与模式识别
2024-09-20 v1 图形学
摘要
我们提出了首个针对参考线稿视频上色的视频扩散框架。不同于依赖单纯图像生成模型逐帧上色的前驱工作,本方法利用大规模预训练视频扩散模型生成彩色动画视频。这种方法在时域一致性方面更有优势,且更擅长处理大位移。首先,我们引入 Sketch-guided ControlNet 提供额外控制,微调图像到视频扩散模型以实现可控视频合成,使其能够基于线稿生成动画视频。随后,我们提出 Reference Attention 以促进从参考帧将颜色传递给包含快速大位移的其他帧。最后,我们提出一种新方案的顺序采样,结合重叠混合模块和 Prev-Reference Attention,将视频扩散模型扩展到原定长度限制之外,以实现长视频上色。定性和定量结果均表明,我们的方法在帧与视频质量及时域一致性方面显著优于最先进的技术。此外,我们的方法能够生成高质量、长时间尺度一致的动画视频,处理大位移,这是以往工作无法实现的。我们的代码和模型已公开,地址为 https://luckyhzt.github.io/lvcd。
关键词
引用
@article{arxiv.2409.12960,
title = {LVCD: Reference-based Lineart Video Colorization with Diffusion Models},
author = {Zhitong Huang and Mohan Zhang and Jing Liao},
journal= {arXiv preprint arXiv:2409.12960},
year = {2024}
}
备注
Accepted by ACM Transactions on Graphics and SIGGRAPH Asia 2024. Project page: https://luckyhzt.github.io/lvcd