从单张图像生成说话头像(?)动画角色4:改进模型及其蒸馏
计算机视觉与模式识别
2023-12-01 v2
摘要
我们研究从单张动漫角色图像创建可实时控制的角色模型的问题。该问题的解决方案将大幅降低虚拟形象、电脑游戏及其他交互式应用的制作成本。Talking Head Anime 3(THA3)是一个试图直接解决该问题的开源项目。它以(1)动漫角色上半身图像和(2)45维姿态向量为输入,输出该角色摆出指定姿态的新图像。其可能的动作范围足以表达个人虚拟形象及某些类型游戏角色。然而,该系统在普通PC上生成动画过慢,且图像质量尚有提升空间。本文从两方面改进THA3。首先,我们提出基于现代生成模型中广泛使用的带注意力U-Net的构成网络新架构,用于旋转角色头部与身体。新架构相比THA3基线一致地产生更好的图像质量。尽管如此,它们也使整个系统明显变慢:生成一帧最多需150毫秒。其次,我们提出一种将该系统蒸馏为小网络(小于2 MB)的技术,该网络可使用消费级游戏GPU实时(低于30 FPS)生成512x512动画帧,同时保持接近完整系统的图像质量。这一改进使整个系统可用于实时应用。
引用
@article{arxiv.2311.17409,
title = {Talking Head(?) Anime from a Single Image 4: Improved Model and Its Distillation},
author = {Pramook Khungurn},
journal= {arXiv preprint arXiv:2311.17409},
year = {2023}
}