UniColor:基于 Transformer 的多模态着色统一框架
计算机视觉与模式识别
2022-09-23 v1 图形学
摘要
我们提出首个统一框架 UniColor,以支持多种模态下的着色,包括无条件与有条件模态,如笔触、示例、文本,甚至它们的混合。我们并非为每类条件学习单独模型,而是引入一个两阶段着色框架,将各种条件整合进单一模型。第一阶段,多模态条件被转换为提示点的统一表示。特别地,我们提出一种基于 CLIP 的新方法将文本转换为提示点。第二阶段,我们提出一个由 Chroma-VQGAN 与 Hybrid-Transformer 组成的基于 Transformer 的网络,以基于提示点生成多样且高质量的着色结果。定性与定量比较均表明,我们的方法在每种控制模态上都优于最先进方法,并进一步实现了此前不可行的多模态着色。此外,我们设计了一个交互界面,展示了我们的统一框架在实际使用中的有效性,包括自动着色、混合控制着色、局部重新着色与迭代颜色编辑。我们的代码与模型见于 https://luckyhzt.github.io/unicolor。
引用
@article{arxiv.2209.11223,
title = {UniColor: A Unified Framework for Multi-Modal Colorization with Transformer},
author = {Zhitong Huang and Nanxuan Zhao and Jing Liao},
journal= {arXiv preprint arXiv:2209.11223},
year = {2022}
}
备注
Accepted by SIGGRAPH Asia 2022. Project page: https://luckyhzt.github.io/unicolor