UniFLG:从文本或语音生成人脸关键点的统一生成器
计算机视觉与模式识别
2023-05-22 v2 计算与语言
声音
音频与语音处理
图像与视频处理
摘要
由于广泛的应用性,人脸说话生成已被广泛研究。人脸说话生成的两个主要框架包括:文本驱动框架,从文本生成同步的语音和说话人脸;以及语音驱动框架,从语音生成说话人脸。为了整合这些框架,本文提出了一种统一的人脸关键点生成器(UniFLG)。所提出的系统利用端到端文本到语音技术,不仅用于合成语音,还用于提取一系列文本和语音共有的潜在表示,并将其输入到关键点解码器以生成人脸关键点。我们证明,与最先进的文本驱动方法相比,我们的系统在语音合成和人脸关键点生成方面均实现了更高的自然度。我们进一步证明,我们的系统能够从没有面部视频数据甚至没有语音数据的说话者的语音中生成人脸关键点。
引用
@article{arxiv.2302.14337,
title = {UniFLG: Unified Facial Landmark Generator from Text or Speech},
author = {Kentaro Mitsui and Yukiya Hono and Kei Sawada},
journal= {arXiv preprint arXiv:2302.14337},
year = {2023}
}
备注
5 pages, 2 figures, 3 tables, accepted for INTERSPEECH 2023. Audio samples: https://rinnakk.github.io/research/publications/UniFLG