面部关键点预测及其在元宇宙中的应用
计算机视觉与模式识别
2022-10-03 v1 机器学习
网络与互联网体系结构
社会与信息网络
摘要
本研究旨在通过从野外视频中学习唇部动画,使元宇宙角色更加逼真。为此,我们的方法是将 Tacotron 2 文本转语音合成器扩展为一次性生成唇部运动与梅尔频谱图。编码器与门控层权重在 LJ Speech 1.1 数据集上预训练,而解码器在从 LRS 3 数据集中提取的 93 段 TED 演讲视频上重新训练。我们的新型解码器利用 OpenFace 2.0 关键点预测器自动提取的标签,预测随时间变化的 20 个唇部关键点位置的位移。训练在不到 5 分钟视频数据下于 7 小时内收敛。我们对 Pre/Post-Net 与预训练编码器权重进行了消融研究,以证明音频与视觉语音数据间迁移学习的有效性。
引用
@article{arxiv.2209.14698,
title = {Facial Landmark Predictions with Applications to Metaverse},
author = {Qiao Han and Jun Zhao and Kwok-Yan Lam},
journal= {arXiv preprint arXiv:2209.14698},
year = {2022}
}