Diffutoon:基于扩散模型的高分辨率可编辑卡通渲染
计算机视觉与模式识别
2024-01-30 v1
摘要
卡通渲染是动画中的一种非真实感渲染任务,其主要目的是以平面化、风格化的外观渲染物体。随着扩散模型跃居图像合成方法的前沿,本文探索了一种基于扩散模型的创新卡通渲染形式,旨在直接将真实感视频渲染为动漫风格。在视频风格化中,现有方法持续面临挑战,尤其是在保持一致性和实现高视觉质量方面。本文将卡通渲染问题建模为四个子问题:风格化、一致性增强、结构引导和着色。为解决视频风格化中的挑战,我们提出了一种名为 Diffutoon 的有效卡通渲染方法。Diffutoon 能够渲染出细节丰富、高分辨率且持续时间长的动漫风格视频。它还可以通过一个附加分支根据提示词编辑内容。Diffutoon 的有效性通过定量指标和人工评估进行了评价。值得注意的是,在我们的实验中,Diffutoon 超越了开源和闭源的基线方法。我们的工作伴随着源代码和示例视频在 Github 上的发布(项目页面:https://ecnu-cilab.github.io/DiffutoonProjectPage/)。
引用
@article{arxiv.2401.16224,
title = {Diffutoon: High-Resolution Editable Toon Shading via Diffusion Models},
author = {Zhongjie Duan and Chengyu Wang and Cen Chen and Weining Qian and Jun Huang},
journal= {arXiv preprint arXiv:2401.16224},
year = {2024}
}