VToonify:可控高分辨率人像视频风格迁移
计算机视觉与模式识别
2022-10-03 v3 图形学
机器学习
摘要
生成高质量艺术化人像视频是计算机图形学与视觉中一项重要且令人向往的任务。尽管已提出一系列基于强大 StyleGAN 构建的成功人像图像卡通化模型,这些面向图像的方法在应用于视频时存在明显局限,如固定帧尺寸、需人脸对齐、缺失非面部细节以及时间不一致性。本文中,我们通过引入新颖的 VToonify 框架来研究具有挑战性的可控高分辨率人像视频风格迁移。具体而言,VToonify 利用 StyleGAN 的中高分辨率层,基于编码器提取的多尺度内容特征来渲染高质量艺术化人像,以更好地保留帧细节。所得全卷积架构接受视频中可变尺寸的非对齐人脸作为输入,有助于在输出中生成具有自然运动的完整人脸区域。我们的框架兼容现有基于 StyleGAN 的图像卡通化模型,将其扩展至视频卡通化,并继承了这些模型在颜色与强度上灵活风格控制的有益特性。本工作给出了基于 Toonify 与 DualStyleGAN 构建的 VToonify 两种实例,分别用于基于集合与基于示例的人像视频风格迁移。大量实验结果证明了我们提出的 VToonify 框架在生成具有灵活风格控制的高质量且时间一致的艺术化人像视频方面优于现有方法。
引用
@article{arxiv.2209.11224,
title = {VToonify: Controllable High-Resolution Portrait Video Style Transfer},
author = {Shuai Yang and Liming Jiang and Ziwei Liu and Chen Change Loy},
journal= {arXiv preprint arXiv:2209.11224},
year = {2022}
}
备注
ACM Transactions on Graphics (SIGGRAPH Asia 2022). Code: https://github.com/williamyang1991/VToonify Project page: https://www.mmlab-ntu.com/project/vtoonify/