利用跨语言自动语音识别发现音素表
声音
2022-01-31 v2 计算与语言
音频与语音处理
摘要
数据获取的高成本使得自动语音识别(ASR)模型训练对大多数现有语言而言十分困难,包括那些甚至没有书写文字或音素表仍未知的语言。过去的工作探索了多语言训练、迁移学习以及零样本学习,以便为这些低资源语言构建 ASR 系统。尽管已表明多语言资源池化是有帮助的,我们尚未看到 ASR 模型成功应用于训练时未见过语言的情况。将 ASR 从已见语言适配到未见语言的关键一步是创建未见语言的音素表。我们工作的最终目标是在无监督方式下、不对语言有任何知识地构建训练时未见过语言的音素表。在本文中,我们 1)研究了不同因素(即模型架构、音位模型、语音表示类型)对未知语言中音素识别的影响;2)分析了哪些音素跨语言迁移良好、哪些不佳,以理解自动音素表创建的局限性与进一步改进方向;以及 3)提出了以无监督方式构建未见语言音素表的不同方法。为此,我们在 13 种语音多样性语言和若干深入分析上进行了单语、多语和跨语言实验。我们发现了一些跨语言识别良好的通用音素标记(IPA 符号)。通过对结果的详细分析,我们得出结论:独特声音、相似声音以及声调语言仍是音素表发现的重大挑战。
引用
@article{arxiv.2201.11207,
title = {Discovering Phonetic Inventories with Crosslingual Automatic Speech Recognition},
author = {Piotr Żelasko and Siyuan Feng and Laureano Moro Velazquez and Ali Abavisani and Saurabhchand Bhati and Odette Scharenborg and Mark Hasegawa-Johnson and Najim Dehak},
journal= {arXiv preprint arXiv:2201.11207},
year = {2022}
}
备注
Accepted for publication in Computer Speech and Language