中文

MuFFIN:基于交互式分层神经网络的多方面发音反馈模型

音频与语音处理 2025-10-08 v2 人工智能

摘要

计算机辅助发音训练(CAPT)通过提供及时且有指导性的反馈帮助二语学习者练习发音技能。现有CAPT方法在发音习得方面大致可分为两类:误 pronunciation 检测与诊断(MDD)以及自动发音评估(APA)。前者旨在定位语音发音错误并提供诊断性反馈,后者则寻求对发音技能的各方面进行量化评估。尽管MDD与APA在本质上具有天然的互补性,但研究者与实践者往往将其视为独立任务,采用不同的建模范式。在此基础上,我们提出MuFFIN(Multi-Faceted pronunciation Feedback model with Interactive hierarchical Neural architecture),以交互式分层神经网络架构联合解决MDD与APA任务。为更好地捕捉音素在特征空间中的细微差异,提出了一种新颖的音素对比有序正则化机制,以优化模型生成更具辨识度的音素特征,同时考虑评分的有序性。此外,为解决MDD中复杂数据不平衡问题,我们设计一种简单而有效的训练目标,专为扰动音素分类器输出而设计,旨在更好地呈现预测音素的分布,同时考虑其误 pronunciation 特征。一系列在Speechocean762基准数据集上的实验表明,我们的方法相较于多个前沿基线具有显著优势,在APA与MDD任务上均实现了最先进的性能。

关键词

引用

@article{arxiv.2510.04956,
  title  = {MuFFIN: Multifaceted Pronunciation Feedback Model with Interactive Hierarchical Neural Modeling},
  author = {Bi-Cheng Yan and Ming-Kang Tsai and Berlin Chen},
  journal= {arXiv preprint arXiv:2510.04956},
  year   = {2025}
}

备注

Accepted and to appear in IEEE/ACM Transactions on Audio, Speech, and Language Processing