中文

OmniColor: 多模态线稿上色的统一框架

计算机视觉与模式识别 2026-03-31 v1

摘要

线稿上色是专业内容创作中的关键阶段,然而在多样化用户约束下实现精确且灵活的结果仍然是一个重大挑战。为此,我们提出了 OmniColor,一个用于多模态线稿上色的统一框架,支持任意组合的控制信号。具体而言,我们将引导信号系统地分为两类:空间对齐条件和语义参考条件。对于空间对齐输入,我们采用双路径编码策略配合密集特征对齐损失(Dense Feature Alignment Loss),以确保严格的边界保持和精确的颜色恢复。对于语义参考输入,我们利用仅视觉语言模型(VLM)的编码方案,并结合时间冗余消除机制来过滤重复信息并提升推理效率。为解决潜在的输入冲突,我们引入了一个自适应空间-语义门控模块,动态平衡多模态约束。实验结果表明,OmniColor 在可控性、视觉质量和时间稳定性方面均取得了优越表现,为线稿上色提供了一个稳健且实用的解决方案。源代码和数据集将开源于 https://github.com/zhangxulu1996/OmniColor。

关键词

引用

@article{arxiv.2603.27531,
  title  = {OmniColor: A Unified Framework for Multi-modal Lineart Colorization},
  author = {Xulu Zhang and Haoqian Du and Xiaoyong Wei and Qing Li},
  journal= {arXiv preprint arXiv:2603.27531},
  year   = {2026}
}