CommonAccent:基于Common Voice探索大型声学预训练模型用于口音分类
计算与语言
2023-05-30 v1 人工智能
机器学习
音频与语音处理
摘要
尽管自动语音识别(ASR)近期取得了进展,带口音语音的识别仍是一个主要问题。为创建更具包容性的ASR系统,研究表明将口音信息作为更大ASR框架的一部分进行整合,可缓解带口音语音的错误。我们通过ECAPA-TDNN和Wav2Vec 2.0/XLSR架构解决多语言口音分类问题,这些架构已被证明在多种语音相关下游任务上表现良好。我们提出了一种基于Common Voice 7.0(英语)和Common Voice 11.0(意大利语、德语和西班牙语)且与SpeechBrain工具包对齐的简易口音分类方案。此外,我们以高达95%的准确率确立了英语口音分类的新最优水平。我们还通过t-SNE研究了Wav2Vec 2.0嵌入的内部归类,注意到存在基于音系相似性的聚类。(我们的方案在SpeechBrain工具包中开源,见:https://github.com/speechbrain/speechbrain/tree/develop/recipes)
引用
@article{arxiv.2305.18283,
title = {CommonAccent: Exploring Large Acoustic Pretrained Models for Accent Classification Based on Common Voice},
author = {Juan Zuluaga-Gomez and Sara Ahmed and Danielius Visockas and Cem Subakan},
journal= {arXiv preprint arXiv:2305.18283},
year = {2023}
}
备注
To appear in Proceedings of the Annual Conference of the International Speech Communication Association, INTERSPEECH 2023