中文

ColorizeDiffusion v2:通过分离效用增强基于参考的素描上色

计算机视觉与模式识别 2025-04-10 v1

摘要

参考基于素描的上色方法因其在动画生产行业中的潜在应用而受到广泛关注。然而,大多数现有方法是在与素描、参考和真实图谱在语义和空间上都 well-aligned 的图像三元组上训练的,而现实世界中的参考和素描往往存在显著的错位。这一训练和推断之间数据分布之间的不匹配导致过拟合,进而导致空间性瑕疵并显著降低整体上色质量,从而限制了当前方法为一般目的服务的潜力。为此,我们对定义为 facilitate reference to sketch 信息传递的潜在表示的carrier进行深入分析。基于此分析,我们提出了一种新颖的工作流程,通过动态适应carrier来优化上色的不同方面。具体而言,对于空间错位的瑕疵,我们引入一种带有空间掩码的split cross-attention机制,使diffusion过程中能够在区域级别上注入参考。为缓解对素描的语义忽视,我们采用专用的背景和风格编码器在潜在特征空间中传递详细的参考信息,实现更好的空间控制和更丰富的细节合成。此外,我们提出了character-mask合并和背景bleaching作为预处理步骤,以提高前景-背景集成和背景生成。广泛的定性和量化评估,包括用户研究,都表明我们提出的方法在与现有方法相比具有优越性能。消融研究进一步验证了每个提议组件的有效性。

关键词

引用

@article{arxiv.2504.06895,
  title  = {ColorizeDiffusion v2: Enhancing Reference-based Sketch Colorization Through Separating Utilities},
  author = {Dingkun Yan and Xinrui Wang and Yusuke Iwasawa and Yutaka Matsuo and Suguru Saito and Jiaxian Guo},
  journal= {arXiv preprint arXiv:2504.06895},
  year   = {2025}
}