3M:一种面向英语发音评估的有效多视角、多粒度与多方面建模方法
声音
2022-09-13 v3 音频与语音处理
信号处理
摘要
作为计算机辅助发音训练(CAPT)不可或缺的组成部分,自动发音评估(APA)通过提供多方面且及时的反馈,在辅助自学者语言学习中发挥着关键作用。然而,至少存在两个潜在障碍可能阻碍其实用性能。一方面,大多数研究仅专注于利用音段(语音)级特征(如发音优度(GOP));但在进行超音段(韵律)级发音评估时,这可能导致特征粒度上的不一致。另一方面,自动发音评估仍受限于缺乏大规模非母语说话人标注语音数据,这不可避免地限制了发音评估的性能。在本文中,我们通过整合多种韵律与音系特征,提供了一种多视角、多粒度与多方面(3M)的发音建模来解决这些问题。具体而言,我们用韵律特征和自监督学习(SSL)特征增强 GOP,同时开发元音/辅音位置嵌入以实现更具音系感知的自动发音评估。在公开可用的 speechocean762 数据集上进行的一系列实验表明,与先前工作相比,我们的方法在多个评估粒度上均取得显著提升,尤其在口语流利度与语音韵律的评估方面。
引用
@article{arxiv.2208.09110,
title = {3M: An Effective Multi-view, Multi-granularity, and Multi-aspect Modeling Approach to English Pronunciation Assessment},
author = {Fu-An Chao and Tien-Hong Lo and Tzu-I Wu and Yao-Ting Sung and Berlin Chen},
journal= {arXiv preprint arXiv:2208.09110},
year = {2022}
}
备注
Accepted to APSIPA ASC 2022