中文

利用短期上下文信息的端到端普通话声调分类

声音 2021-12-20 v3 机器学习 音频与语音处理

摘要

本文提出一种利用谱图与短期上下文信息作为输入的连续语音端到端普通话声调分类方法。谱图与上下文段特征均用于训练声调分类器。我们首先使用 ASR 模型生成的强制对齐结果将谱图帧划分为音节段,然后提取短期段特征以捕获跨多音节的上下文信息。将谱图与短期上下文段特征一同输入端到端模型可显著提升性能。我们在大规模开源普通话语音数据集上实验评估所提方法。结果表明,该方法在 AISHELL3 数据库上将分类准确率从 79.5% 提升至 92.6%。

关键词

引用

@article{arxiv.2104.05657,
  title  = {End-to-End Mandarin Tone Classification with Short Term Context Information},
  author = {Jiyang Tang and Ming Li},
  journal= {arXiv preprint arXiv:2104.05657},
  year   = {2021}
}

备注

Accepted by APSIPA ASC 2021