中文

多任务预训练以提升可解释 L2 发音评估

计算与语言 2025-09-23 v1

摘要

自动发音评估 (Automatic Pronunciation Assessment, APA) 通过提供细粒度发音反馈来分析二语学习者的发音。现有方法通常采用片段级特征作为输入,通过层次(或并行)发音建模在不同粒度上预测发音分数。这导致跨语言水平(如音素、词、句子)的评估仅依赖于音素级发音特征,几乎忽略了超片段发音线索。为此,我们提出一种用于 APA 的多任务预训练 (MTP) 策略,旨在捕捉长期时序发音线索,同时通过重建输入特征的目标加强 utterance 内的内在结构。具体而言,对于 APA 模型的音素级编码器,所提出的 MTP 策略随机遮蔽片段级发音特征,并基于其周围发音上下文重建被遮蔽的特征。此外,当前 APA 系统缺乏与自动Speaking Assessment (ASA) 的集成,限制了整体熟练度评估。基于经验研究与ASA 先前知识,我们的框架通过整合手工特征 (Handcrafted Features, HCFs),如语速、沉默时长等流畅性指标,以及重音强度等应力指标,从人类设计公式中提取,通过回归器生成可解释的熟练度分数。在 speechocean762 数据集上实验表明,我们的方法在发音评分与ASA熟练度相关性方面取得改善,实现了针对性训练与综合熟练度评估。

关键词

引用

@article{arxiv.2509.16876,
  title  = {Multi-task Pretraining for Enhancing Interpretable L2 Pronunciation Assessment},
  author = {Jiun-Ting Li and Bi-Cheng Yan and Yi-Cheng Wang and Berlin Chen},
  journal= {arXiv preprint arXiv:2509.16876},
  year   = {2025}
}

备注

Accepted by APSIPA-ASC 2025