基于动画创建工作流程的图像参考素描上色
计算机视觉与模式识别
2025-02-28 v1 多媒体
摘要
素描上色在动画和数字插画生产任务中发挥着重要作用。然而,现有方法仍存在文本引导方法难以提供准确颜色和风格参考、提示引导方法仍涉及手动操作以及图像参考方法容易引发图像伪影等问题。为此,我们提出一种受真实世界动画制作工作流程启发的扩散框架。我们的ethods 利用素描作为空间指导,同时将 RGB 图像作为颜色参考,分别通过空间掩码从参考图像中提取前景与背景。特别地,我们引入带 LoRA (低秩适配) 模块的分割交叉注意力机制。这些机制分别以前景和背景区域进行训练,以控制交叉注意力中键和值的相应嵌入。这种设计使扩散模型能够独立地整合前景和背景信息,防止相互干扰,从而消除空间伪影。在推理阶段,我们通过改变框架中激活的模块,设计出适用于不同使用场景的可切换推理模式。大量定性和定量实验,以及用户研究,均表明我们在生成无几何错位参考图像的高质量无伪影结果方面优于现有方法。消融研究进一步确认了每个组件的有效性。代码已公开于 https://github.com/tellurion-kanata/colorizeDiffusion。
引用
@article{arxiv.2502.19937,
title = {Image Referenced Sketch Colorization Based on Animation Creation Workflow},
author = {Dingkun Yan and Xinrui Wang and Zhuoru Li and Suguru Saito and Yusuke Iwasawa and Yutaka Matsuo and Jiaxian Guo},
journal= {arXiv preprint arXiv:2502.19937},
year = {2025}
}