中文

3M:一种面向英语发音评估的有效多视角、多粒度与多方面建模方法

声音 2022-09-13 v3 音频与语音处理 信号处理

摘要

作为计算机辅助发音训练(CAPT)不可或缺的组成部分,自动发音评估(APA)通过提供多方面且及时的反馈,在辅助自学者语言学习中发挥着关键作用。然而,至少存在两个潜在障碍可能阻碍其实用性能。一方面,大多数研究仅专注于利用音段(语音)级特征(如发音优度(GOP));但在进行超音段(韵律)级发音评估时,这可能导致特征粒度上的不一致。另一方面,自动发音评估仍受限于缺乏大规模非母语说话人标注语音数据,这不可避免地限制了发音评估的性能。在本文中,我们通过整合多种韵律与音系特征,提供了一种多视角、多粒度与多方面(3M)的发音建模来解决这些问题。具体而言,我们用韵律特征和自监督学习(SSL)特征增强 GOP,同时开发元音/辅音位置嵌入以实现更具音系感知的自动发音评估。在公开可用的 speechocean762 数据集上进行的一系列实验表明,与先前工作相比,我们的方法在多个评估粒度上均取得显著提升,尤其在口语流利度与语音韵律的评估方面。

关键词

引用

@article{arxiv.2208.09110,
  title  = {3M: An Effective Multi-view, Multi-granularity, and Multi-aspect Modeling Approach to English Pronunciation Assessment},
  author = {Fu-An Chao and Tien-Hong Lo and Tzu-I Wu and Yao-Ting Sung and Berlin Chen},
  journal= {arXiv preprint arXiv:2208.09110},
  year   = {2022}
}

备注

Accepted to APSIPA ASC 2022