合成说话儿童——为何需要及如何生成
人机交互
2023-11-14 v1 人工智能
声音
音频与语音处理
摘要
当代人机交互(HCI)研究主要依赖神经网络模型来实现系统用户的机器视觉与语音理解。此类模型需要大量标注的训练数据集以达到最优性能,而当为年幼儿童等脆弱群体用户构建接口时,GDPR 给数据收集、管理与处理带来了显著复杂性。受 Edge AI 智能玩具平台训练需求驱动,本研究探索生成式神经技术的最新进展,并提供了一套可控的、大规模语音驱动面部训练数据生成流水线的工作概念验证。在此背景下,我们展示了如何微调 StyleGAN2 以创建性别均衡的儿童人脸数据集。该数据集包含多种可控因素,如面部表情、年龄变化、面部姿态,甚至具有真实唇形同步的语音驱动动画。通过结合用于儿童语音合成的生成式文本转语音模型与基于 3D landmarks 的说话头流水线,我们能生成高度真实、完全合成的说话儿童视频片段。这些视频片段可为神经网络模型提供宝贵且可控的合成训练数据,在真实数据因隐私法规而稀缺或受限时弥合缺口。
引用
@article{arxiv.2311.06307,
title = {Synthetic Speaking Children -- Why We Need Them and How to Make Them},
author = {Muhammad Ali Farooq and Dan Bigioi and Rishabh Jain and Wang Yao and Mariam Yiwere and Peter Corcoran},
journal= {arXiv preprint arXiv:2311.06307},
year = {2023}
}
备注
Presented at SpeD 23