中文

声学特征混合用于均衡的多方面发音评估

计算与语言 2024-06-25 v1 人工智能 声音 音频与语音处理

摘要

在自动化发音评估中,近期的关注点逐渐转向评估多个方面以提供更丰富的反馈。然而,为非母语语言学习者的语音获取多方面评分标签数据具有挑战性;此外,这常导致评分不平衡的分布。本文提出了两种声学特征混合策略,线性和非线性地与批内平均特征插值,以解决数据稀缺和评分标签不平衡问题。主要使用发音良好度作为声学特征,我们针对发音评估设计了混合方案。进一步,我们通过将语音识别结果与原始答案音素进行比较,整合细粒度错误率特征,从而为误发音提供直接提示。有效混合声学特征显著提升了在speechocean762数据集上的整体评分性能,详细分析突显了我们对预测未见扭曲的潜力。

关键词

引用

@article{arxiv.2406.15723,
  title  = {Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment},
  author = {Heejin Do and Wonjun Lee and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2406.15723},
  year   = {2024}
}

备注

Interspeech 2024