听上去很熟悉:语音表征跨语言迁移的分析
音频与语音处理
2020-05-19 v1 计算与语言
声音
摘要
世界上仅有少数语言拥有丰富资源以支撑语音处理技术的实际应用。克服此问题的方法之一是使用其他语言中的资源来训练多语言自动语音识别(ASR)模型,直觉上该模型应学习到某些通用的语音表征。本工作中,我们聚焦于更深入地理解这些表征可能具有的通用性,以及单个音素在多语言设定下如何得到改善。为此,我们选取了一组语音上多样化的语言,并进行了一系列单语、多语与跨语言(零样本)实验。ASR被训练以识别国际音标(IPA)标记序列。我们观察到多语言设定下所有语言均有显著改善,而跨语言设定下性能急剧退化,其中模型除其他错误外还将爪哇语误判为声调语言。值得注意的是,仅10小时目标语言训练数据便极大降低了ASR错误率。我们的分析揭示,即便是仅存于单一语言的音素也可从添加其他语言训练数据中大幅获益——这对低资源语音界而言是令人鼓舞的结果。
引用
@article{arxiv.2005.08118,
title = {That Sounds Familiar: an Analysis of Phonetic Representations Transfer Across Languages},
author = {Piotr Żelasko and Laureano Moro-Velázquez and Mark Hasegawa-Johnson and Odette Scharenborg and Najim Dehak},
journal= {arXiv preprint arXiv:2005.08118},
year = {2020}
}
备注
Submitted to Interspeech 2020. For some reason, the ArXiv Latex engine rendered it in more than 4 pages