利用自监督语音模型中的全音位效应进行异常发音评估
计算与语言
2025-03-25 v2 人工智能
机器学习
音频与语音处理
摘要
全音位效应指的是基于音素的语音环境导致的发音变体。建模全音位效应对于异常发音评估至关重要,这涉及区分异常发音与典型发音。然而,最近的基于音素分类器的方法常通过将各种实现视为单个音素来简化这一问题,绕过了对全音位变体建模的复杂性。我们受到冻结自监督语音模型 (S3M) 特征的声学建模能力启发,提出了 MixGoP 方法,该方法利用高斯混合模型来建模具有多个子簇的音素分布。我们的实验表明,MixGoP 在四个五个数据集中实现了最先进的性能,包括困难性言语和非母语语音。我们的分析进一步表明,S3M 特征比 MFCC 和 Mel 频谱图更有效地捕获了全音位变体,突显了将 MixGoP 与 S3M 特征集成的优势。
引用
@article{arxiv.2502.07029,
title = {Leveraging Allophony in Self-Supervised Speech Models for Atypical Pronunciation Assessment},
author = {Kwanghee Choi and Eunjung Yeo and Kalvin Chang and Shinji Watanabe and David Mortensen},
journal= {arXiv preprint arXiv:2502.07029},
year = {2025}
}
备注
Accepted to NAACL 2025. Codebase available at https://github.com/juice500ml/acoustic-units-for-ood