语音拼贴:通过拼接单语语料库生成码切换音频
声音
2023-09-28 v1 计算与语言
机器学习
音频与语音处理
摘要
设计有效的码切换(CS)自动语音识别(ASR)系统通常依赖于已转写的 CS 资源的可获得性。为解决数据稀缺问题,本文提出 Speech Collage,一种通过拼接音频片段从单语语料库合成 CS 数据的方法。我们进一步使用重叠相加方法改善音频生成的平滑质量。我们研究了生成数据在两种场景下的语音识别影响:使用域内 CS 文本与采用合成 CS 文本的零样本方法。实证结果突显了域内和零样本场景下混合错误率与词错误率分别最高相对降低 34.4% 和 16.2%。最后,我们证明 CS 增强增强了模型的码切换倾向并降低了其单语偏差。
引用
@article{arxiv.2309.15674,
title = {Speech collage: code-switched audio generation by collaging monolingual corpora},
author = {Amir Hussein and Dorsa Zeinali and Ondřej Klejch and Matthew Wiesner and Brian Yan and Shammur Chowdhury and Ahmed Ali and Shinji Watanabe and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2309.15674},
year = {2023}
}