中文

HiPPO:探索一种面向口语语言的新型分层发音评估方法

音频与语音处理 2025-12-05 v1

摘要

自动化发音评估(APA)旨在通过提供及时和精细的诊断性反馈,对第二语言(L2)学习者的发音熟练程度进行量化。目前大多数 APA 研究主要集中在高度受约束的阅读朗读任务(学习者被要求朗读参考文本)上;然而,评估非结构化语音(或自由说话情景)中的发音质量仍相对不足。鉴于此,本文首先提出了 HiPPO,一种针对口语语言的分层发音评估模型,该模型仅依据学习者所发言的语音,在多个语言水平上评估 L2 学习者的口语熟练程度。为提高整体评估准确性,本文引入对比序数正则化和课程学习策略进行模型训练。前者旨在通过利用回归目标的序数特性生成具有判别性的特征,而后者则逐步增加训练复杂度,以便于以非结构化语音作为输入完成评估任务。在 Speechocean762 数据集上的实验验证了该方法在多个前沿基准方法面前的可行性和优越性。

关键词

引用

@article{arxiv.2512.04964,
  title  = {HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages},
  author = {Bi-Cheng Yan and Hsin-Wei Wang and Fu-An Chao and Tien-Hong Lo and Yung-Chang Hsu and Berlin Chen},
  journal= {arXiv preprint arXiv:2512.04964},
  year   = {2025}
}

备注

Accepted and to appear in AACL-IJCNLP2025