SCRAPS:声学与语音空间的语音对比表征
声音
2024-02-01 v2 人工智能
音频与语音处理
摘要
文献中大量实例证明深度学习模型能够处理多模态数据。近来,CLIP 使深度学习系统能够学习图像与文本描述之间的共享潜在空间,在下游任务中取得出色的零样本或少样本结果。在本文中,我们探索 CLIP 提出的相同思想,但应用于语音领域,其中语音与声学空间通常共存。我们训练了一个基于 CLIP 的模型,旨在学习语音与声学空间的共享表征。结果显示,所提模型对语音变化敏感,随机替换 20% 音素时得分下降 91%,同时对各类噪声具有显著鲁棒性,在音频混入 75% 高斯噪声时性能仅下降 10%。我们还提供经验证据,表明所得嵌入对多种下游应用有用,例如可懂度评估,以及在语音生成任务中利用丰富的预训练语音嵌入的能力。最后,我们讨论了在语音生成与识别领域具有有趣意义的潜在应用。
引用
@article{arxiv.2307.12445,
title = {SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces},
author = {Ivan Vallés-Pérez and Grzegorz Beringer and Piotr Bilinski and Gary Cook and Roberto Barra-Chicote},
journal= {arXiv preprint arXiv:2307.12445},
year = {2024}
}
备注
In proceedings of the 26th European Conference on Artificial Intelligence ECAI 2023. 8 pages + 1 appendix page