VanGogh:基于统一多模态扩散框架的视频彩色化
计算机视觉与模式识别
2025-01-17 v1
摘要
视频彩色化旨在将灰度视频转换为保持时间一致性和结构完整性的生动彩色表示。现有的视频彩色化方法常常存在颜色漂移且缺乏针对复杂运动或多样化语义线索的全面控制。为此,我们引入VanGogh,一个统一的多模态扩散框架用于视频彩色化。VanGogh采用Dual Qformer对来自多个模态的特征进行对齐与融合,辅以基于深度的生成过程和光流损失,以减少颜色溢出。此外,实施颜色注入策略和亮度通道替换,以提高泛化性并缓解闪烁性状。得益于此设计,用户可对生成过程进行全局和局部控制,实现更高质量的彩色化视频。广泛的定性和定量评估,以及用户研究,表明VanGogh在保持时间一致性和颜色保真性方面具有优势。项目页面:https://becauseimbatman0.github.io/VanGogh。
引用
@article{arxiv.2501.09499,
title = {VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization},
author = {Zixun Fang and Zhiheng Liu and Kai Zhu and Yu Liu and Ka Leong Cheng and Wei Zhai and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2501.09499},
year = {2025}
}