中文

生成式数据增强挑战:零样文本到语音合成用于个性化语音增强

音频与语音处理 2025-01-24 v1 人工智能

摘要

本文提出了一项新挑战, 要求零样文本到语音 (TTS) 系统用于增强下游任务中的个性化语音增强 (PSE) 数据, 作为ICASSP 2025生成式数据增强研讨会的一部分。由于隐私顾虑和从测试场景录制音频的技术困难, 收集高质量个性化数据具有挑战性。为解决这些问题, 使用生成模型进行合成数据生成已受到广泛关注。在本挑战中, 参赛者首先需要构建零样TTS系统以增强个性化数据。随后, PSE系统需使用此增强的个性化数据集进行训练。通过本挑战, 我们旨在探讨由零样TTS模型生成的增强数据质量如何影响PSE模型性能。我们提供了使用开源零样TTS模型的基线实验, 以鼓励参与并衡量进展。我们的基线代码实现和检查点均已在线上提供。

关键词

引用

@article{arxiv.2501.13372,
  title  = {Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement},
  author = {Jae-Sung Bae and Anastasia Kuznetsova and Dinesh Manocha and John Hershey and Trausti Kristjansson and Minje Kim},
  journal= {arXiv preprint arXiv:2501.13372},
  year   = {2025}
}

备注

Accepted to ICASSP 2025 Satellite Workshop: Generative Data Augmentation for Real-World Signal Processing Applications