低资源环境下无需 L2 发音数据集的发音错误检测:以芬兰瑞典语为例
计算与语言
2025-08-21 v1 声音
音频与语音处理
摘要
发音错误检测(MD)模型是许多语言学习应用的基石。遗憾的是,大多数系统是为英语及其他主要语言构建的,而芬兰瑞典语(FS)等低资源语言变体缺乏此类工具。在本文中,我们介绍了针对 FS 的 MD 模型,该模型在 89 小时的第一语言(L1)说话者自发语音上进行训练,并在 33 分钟的 L2 朗读转录语音上进行测试。我们训练了一个带有熵正则化的多语言 wav2vec 2.0 模型,随后在推理后进行温度缩放和 top-k 归一化,以使其更好地适应 MD。我们方法的主要创新在于其简单性,仅需极少的 L2 数据。该过程亦与语言无关,使其适用于其他低资源语言。与基线模型的召回率(77.5%)和精确率(17.6%)相比,我们提出的算法能够平衡召回率(43.2%)和精确率(29.8%)。
引用
@article{arxiv.2506.01156,
title = {Mispronunciation Detection Without L2 Pronunciation Dataset in Low-Resource Setting: A Case Study in Finland Swedish},
author = {Nhan Phan and Mikko Kuronen and Maria Kautonen and Riikka Ullakonoja and Anna von Zansen and Yaroslav Getman and Ekaterina Voskoboinik and Tamás Grósz and Mikko Kurimo},
journal= {arXiv preprint arXiv:2506.01156},
year = {2025}
}
备注
Accepted to Interspeech 2025 conference