用于保护濒危语言拉定语的语音表示与音素分类
音频与语音处理
2021-08-31 v1 计算与语言
机器学习
摘要
世界上 7,000 种口语中绝大多数预计将在本世纪内消失,包括来自意大利阿尔卑斯山的濒危语言拉定语。致力于保护语言语音与音系结构语言学家,可能花费数小时转写母语者每一分钟语音。针对拉定语的这一问题,我们的论文首次呈现了用于分类拉定语 32 个音素的语音表示与机器学习模型分析。我们以拉定语 Fascian 方言的新数据集进行实验,该数据来自意大利的母语者。我们创建了帧级与段级语音特征提取方法,并使用在 9 种不同语音表示上训练的 8 种不同分类器进行了广泛实验。我们的语音表示从传统特征(MFCC、LPC)到用深度神经网络模型(自编码器、LSTM 自编码器与 WaveNet)学习的特征。我们性能最佳的 classifier 在 MFCC 语音信号表示上训练,在所有拉定语音素上取得了 86% 的平均准确率。对于所有考察的拉定语音素子组,我们也获得了 above 77% 的平均准确率。我们的发现为学习有判别力的拉定语音素表示提供了见解,并展示了利用机器学习与语音信号处理来保护拉定语及其他濒危语言的潜力。
引用
@article{arxiv.2108.12531,
title = {Speech Representations and Phoneme Classification for Preserving the Endangered Language of Ladin},
author = {Zane Durante and Leena Mathur and Eric Ye and Sichong Zhao and Tejas Ramdas and Khalil Iskarous},
journal= {arXiv preprint arXiv:2108.12531},
year = {2021}
}
备注
Accepted to ICSA MLSLP 2021 (held with Interspeech 2021)