基于 MFCC 的 L1 对 L2 发音建模:面向可解释机器学习与教学反馈的框架
摘要
本研究探讨了 Mel 频率倒数系数 (MFCC) 在捕捉第二语言 (L2) 英语语音中第一语言 (L1) 迁移程度方面的作用。从 GMU Speech Accent Archive 中提取普通话和美式英语 L1 说话者的语音样本,转换为 WAV 格式并处理,得到每个说话者 13 个 MFCC。结合推论统计学 (t 检验、MANOVA、正交判别分析) 和机器学习 (随机森林分类) 的多方法分析框架,识别出 MFCC-1(宽带能量)、MFCC-2(首声道区域)和 MFCC-5(共振与摩擦能量)作为区分 L1 背景最具判别性的特征。使用这些 MFCC 的降维特征模型显著优于完整特征模型,经 McNemar 检验和非重叠置信区间验证。研究结果经验性地支持了 L2 的感知同化模型 (PAM-L2) 和言语学习模型 (SLM),表明 L1 条件下的 L2 语音变异既感知上有依据,又可被声学量化。方法论层面,本研究为应用语言学和可解释人工智能贡献了透明、数据高效的 L2 发音建模管线。结果亦为 ESL/EFL 教学提供了教学意义,通过突出 L1 特定特征,为以可理解性为导向的教学、课程设计及语音评估工具提供了信息。
引用
@article{arxiv.2504.13765,
title = {Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback},
author = {Peyman Jahanbin},
journal= {arXiv preprint arXiv:2504.13765},
year = {2025}
}
备注
27 pages (including references), 4 figures, 1 table. Combines statistical inference and explainable machine learning to model L1 influence in L2 pronunciation using MFCC features. Methodology and code are openly available via Zenodo and OSF: Zenodo: https://doi.org/10.5281/zenodo.15186197 OSF: https://doi.org/10.17605/OSF.IO/4UXGM