SingingHead:一个用于歌唱头部动画的大规模4D数据集
计算机视觉与模式识别
2024-07-16 v3
摘要
歌唱作为一种仅次于说话的面部运动,可被视为跨种族和文化的通用语言,在情感交流、艺术和娱乐中扮演着重要角色。然而,由于缺乏歌唱头部数据集以及歌唱与说话在节奏和幅度上存在领域差异,它在音频驱动的面部动画领域常常被忽视。为此,我们收集了一个高质量的大规模歌唱头部数据集SingingHead,该数据集包含来自76位个体和8种音乐类型的超过27小时的同步歌唱视频、3D面部运动、歌唱音频和背景音乐。伴随SingingHead数据集,我们在歌唱任务上对现有的音频驱动3D面部动画方法和2D说话头部方法进行了基准测试。此外,我们认为3D和2D面部动画任务可以一起解决,并提出了一个名为UniSinger的统一歌唱头部动画框架,以实现歌唱音频驱动的3D歌唱头部动画和2D歌唱肖像视频合成,该框架在3D和2D基准测试上均取得了有竞争力的结果。大量实验证明了所提出的歌唱特定数据集在促进歌唱头部动画任务发展方面的重要性,以及我们统一面部动画框架的优异性能。
引用
@article{arxiv.2312.04369,
title = {SingingHead: A Large-scale 4D Dataset for Singing Head Animation},
author = {Sijing Wu and Yunhao Li and Weitian Zhang and Jun Jia and Yucheng Zhu and Yichao Yan and Guangtao Zhai and Xiaokang Yang},
journal= {arXiv preprint arXiv:2312.04369},
year = {2024}
}
备注
Project page: https://wsj-sjtu.github.io/SingingHead/