从音频生成面部关键点序列
计算机视觉与模式识别
2020-11-03 v1 多媒体
摘要
每当我们说话时,声音都伴随着面部动作与表情。近期的若干工作展示了高度照片真实感说话人脸视频的合成,但它们要么需要源视频来驱动目标人脸,要么仅生成具有固定头部姿态的视频。这种面部动作的缺失是因为大多数工作聚焦于与音频同步的唇部运动,同时假设其余面部关键点为固定性质。为此,我们引入了一个超过 150,000 段、224p 和 25fps 的独特音频-关键点数据集,其关联了给定音频下的面部关键点运动。该数据集随后被用于训练模型 Audio2Keypoint——一种用于合成与音频相匹配的面部关键点运动的全新方法。给定目标人物的单张图像和一段音频序列(任意语言),Audio2Keypoint 生成与输入音频同步的、以输入图像为条件以保留目标人物面部特征的合理关键点运动序列。据我们所知,这是首项提出音频-关键点数据集并学习一个模型以输出与任意长度音频相匹配的合理关键点序列的工作。Audio2Keypoint 可泛化至具有不同面部结构的未见人物,使我们能用任何来源的语音甚至合成语音生成序列。与学习从音频到视频域的直接映射不同,本工作旨在学习音频-关键点映射,其允许平面内与平面外头部旋转,同时使用姿态不变(PIV)编码器保留人物身份。
引用
@article{arxiv.2011.01114,
title = {Facial Keypoint Sequence Generation from Audio},
author = {Prateek Manocha and Prithwijit Guha},
journal= {arXiv preprint arXiv:2011.01114},
year = {2020}
}