中文

3D-Speaker:用于语音表征解耦的大规模多设备、多距离与多方言语料库

计算与语言 2023-09-26 v3 声音 音频与语音处理

摘要

解耦语音语句中不相关信息是语音领域的一项重要研究课题。不同的语音相关任务侧重于提取不同的语音表征,同时最小化其他不相关信息的影响。我们提出一个大规模语音语料库以促进语音表征解耦的研究。3D-Speaker包含超过10,000名说话人,每位说话人同时由多种设备录制,位于不同距离,且部分说话人使用多种方言说话。多维音频数据的受控组合产生了一个多样化语音表征纠缠混合的矩阵,从而激发有趣的方法将其解开。3D-Speaker的多域特性也使其成为评估大型通用语音模型以及实验域外学习和自监督学习方法的合适资源。https://3dspeaker.github.io/

关键词

引用

@article{arxiv.2306.15354,
  title  = {3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement},
  author = {Siqi Zheng and Luyao Cheng and Yafeng Chen and Hui Wang and Qian Chen},
  journal= {arXiv preprint arXiv:2306.15354},
  year   = {2023}
}