声学特征混合用于均衡的多方面发音评估
计算与语言
2024-06-25 v1 人工智能
声音
音频与语音处理
摘要
在自动化发音评估中,近期的关注点逐渐转向评估多个方面以提供更丰富的反馈。然而,为非母语语言学习者的语音获取多方面评分标签数据具有挑战性;此外,这常导致评分不平衡的分布。本文提出了两种声学特征混合策略,线性和非线性地与批内平均特征插值,以解决数据稀缺和评分标签不平衡问题。主要使用发音良好度作为声学特征,我们针对发音评估设计了混合方案。进一步,我们通过将语音识别结果与原始答案音素进行比较,整合细粒度错误率特征,从而为误发音提供直接提示。有效混合声学特征显著提升了在speechocean762数据集上的整体评分性能,详细分析突显了我们对预测未见扭曲的潜力。
引用
@article{arxiv.2406.15723,
title = {Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment},
author = {Heejin Do and Wonjun Lee and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2406.15723},
year = {2024}
}
备注
Interspeech 2024