基于预训练文本到图像扩散模型的视频上色
计算机视觉与模式识别
2023-06-05 v1 人工智能
图形学
摘要
视频上色是一项具有挑战性的任务,涉及为灰度帧推断合理且时间一致的色彩。在本文中,我们提出 ColorDiffuser,一种将预训练文本到图像潜在扩散模型适配用于视频上色的方法。借助所提出的基于适配器的方法,我们将预训练的文本到图像模型重新用于接受输入灰度视频帧以及可选文本描述以进行视频上色。为增强时间连贯性并保持各帧上色的生动性,我们提出两种新技术:色彩传播注意力(Color Propagation Attention)与交替采样策略(Alternated Sampling Strategy)。色彩传播注意力使模型能够基于参考潜在帧优化其上色决策,而交替采样策略在生成式扩散采样步骤中交替使用下一帧和前一帧相邻潜在帧作为参考,从而捕获时空依赖关系。这促进了相邻视频帧之间的双向色彩信息传播,改善了跨帧色彩一致性。我们在基准数据集上进行了大量实验,结果证明了我们所提框架的有效性。评估显示 ColorDiffuser 在视频上色中达到了最先进(SOTA)性能,在色彩保真度、时间一致性和视觉质量方面超越了现有方法。
引用
@article{arxiv.2306.01732,
title = {Video Colorization with Pre-trained Text-to-Image Diffusion Models},
author = {Hanyuan Liu and Minshan Xie and Jinbo Xing and Chengze Li and Tien-Tsin Wong},
journal= {arXiv preprint arXiv:2306.01732},
year = {2023}
}
备注
project page: https://colordiffuser.github.io/