中文

面向高分辨率和解缠的参考基准素描上色

计算机视觉与模式识别 2026-03-10 v2

摘要

素描上色是自动化和辅助创建动画和数字插画的关键任务。以往研究确定主要难点在于语义对齐的训练数据分布与高度多样的测试数据之间的分布迁移,侧重于缓解分布迁移引起的伪影,而非从根本上解决问题。本文提出一种框架,直接最小化分布迁移,从而实现更高质量、更高分辨率和更好的可控性的上色。我们提出双分支框架,分别通过语义对齐分支和语义错位分支显式建模训练过程和推理过程的数据分布。在两个分支的特征图上应用 Gram 正则化损失,有效强制跨域分布一致性和稳定性。此外,我们采用面向动画的 Tagger 网络从参考图像中提取细粒度属性,并调制 SDXL 的条件编码器以确保精确控制,以及一个插件模块来增强纹理传递。定量和定性比较,以及用户研究均确认我们的方法有效克服了分布迁移挑战,在质量和可控性指标上均实现了最先进的性能。消融研究揭示了每个组件的影响。

关键词

引用

@article{arxiv.2603.05971,
  title  = {Towards High-resolution and Disentangled Reference-based Sketch Colorization},
  author = {Dingkun Yan and Xinrui Wang and Ru Wang and Zhuoru Li and Jinze Yu and Yusuke Iwasawa and Yutaka Matsuo and Jiaxian Guo},
  journal= {arXiv preprint arXiv:2603.05971},
  year   = {2026}
}