中文

利用 TTS 数据增强改进说话人脸系统的少样本学习

声音 2023-03-10 v1 多媒体 音频与语音处理

摘要

音频驱动的说话人脸近来引起了学术界与工业界的广泛兴趣。然而,音频驱动说话人脸中的数据获取与标注劳动密集且成本高昂。数据资源的缺乏导致合成效果差。为缓解此问题,我们提出使用 TTS(文本转语音)进行数据增强,以提升说话人脸系统的少样本能力。TTS 音频带来的错位问题通过引入 soft-DTW 解决,其首次被采用于说话人脸任务中。此外,探索了由 HuBERT 提取的特征以利用音频的潜在信息,并发现其优于其他特征。所提方法在 MSE 分数、DTW 分数与用户研究偏好上分别相较基线模型取得 17%、14%、38% 的优势,显示了利用 TTS 增强改进说话人脸系统少样本学习的有效性。

关键词

引用

@article{arxiv.2303.05322,
  title  = {Improving Few-Shot Learning for Talking Face System with TTS Data Augmentation},
  author = {Qi Chen and Ziyang Ma and Tao Liu and Xu Tan and Qu Lu and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2303.05322},
  year   = {2023}
}

备注

4 pages. Accepted by ICASSP 2023