中文

基于语言-声学相似度的口音偏移用于口音识别

声音 2022-07-04 v2 音频与语音处理

摘要

通用口音识别(AR)模型倾向于直接从频谱中提取低级信息,这通常会在说话人或通道上显著过拟合。考虑到口音可被视为一系列相对于母语发音的偏移,将口音偏移作为输入将使区分口音成为一项更简单的任务。但由于缺乏母语话语作为锚点,估计口音偏移十分困难。本文提出了基于语言-声学相似度的口音偏移(LASAS)用于AR任务。对于一段口音话语,在将其对应的文本向量映射到多个口音关联空间作为锚点后,其口音偏移可通过声学嵌入与这些锚点之间的相似度来估计。然后,我们将口音偏移与降维后的文本向量拼接,以获得语言-声学双模态表示。与纯声学嵌入相比,该双模态表示通过充分利用语言和声学信息而更丰富、更清晰,能有效提升AR性能。在带口音英语语音识别挑战赛(AESRC)数据集上的实验表明,我们的方法在测试集上达到了77.42%的准确率,相较于挑战赛中一个有竞争力的系统获得了6.94%的相对提升。

关键词

引用

@article{arxiv.2204.03398,
  title  = {Linguistic-Acoustic Similarity Based Accent Shift for Accent Recognition},
  author = {Qijie Shao and Jinghao Yan and Jian Kang and Pengcheng Guo and Xian Shi and Pengfei Hu and Lei Xie},
  journal= {arXiv preprint arXiv:2204.03398},
  year   = {2022}
}

备注

Accepted by Interspeech 2022