ColorMNet:用于视频着色的基于记忆的深度时空特征传播网络
计算机视觉与模式识别
2024-04-10 v1
摘要
如何有效探索时空特征对视频着色至关重要。我们开发了一种基于记忆的特征传播模块,该模块能够与远距离帧的特征建立可靠连接,并减轻不准确估计特征的影响,而不是沿时间维度堆叠多帧或循环传播会累积误差且无法从远距离帧探索信息的估计特征。为了从每帧中提取更好的特征以进行上述特征传播,我们探索了来自大型预训练视觉模型的特征以指导每帧的特征估计,从而使估计的特征能够对复杂场景进行建模。此外,我们注意到相邻帧通常包含相似的内容。为了利用这一特性以更好地进行时空特征利用,我们开发了一个局部注意力模块,以聚合时空邻域内相邻帧的特征。我们将基于记忆的特征传播模块、大型预训练视觉模型引导的特征估计模块和局部注意力模块构建为一个端到端可训练网络(命名为 ColorMNet),并表明它在基准数据集和真实场景中均优于最先进的方法。源代码和预训练模型将在 \url{https://github.com/yyang181/colormnet} 上提供。
引用
@article{arxiv.2404.06251,
title = {ColorMNet: A Memory-based Deep Spatial-Temporal Feature Propagation Network for Video Colorization},
author = {Yixin Yang and Jiangxin Dong and Jinhui Tang and Jinshan Pan},
journal= {arXiv preprint arXiv:2404.06251},
year = {2024}
}
备注
Project website: \url{https://github.com/yyang181/colormnet}