中文

一种用于普通话口音识别与转换的新方法

音频与语音处理 2020-08-11 v1 计算与语言 机器学习 声音

摘要

分别提出并探讨了两种用于口音分类和转换的新方法。第一个主题是汉语口音分类/识别。第二个主题是使用编码器-解码器模型进行端到端汉语口音转换,其中第一个主题中的分类器用于口音转换器编码器-解码器模型的训练。针对口音识别,使用不同特征和模型进行了实验。这些特征包括 MFCC 和谱图。分类器模型为 TDNN 和 1D-CNN。在具有 5 类口音的 MAGICDATA 数据集上,在 MFCC 特征上训练的 TDNN 分类器达到了 54% 的测试准确率和 0.54 的测试 F1 分数,而在谱图上训练的 1D-CNN 分类器达到了 62% 的测试准确率和 0.62 的测试 F1 分数。还给出了一个端到端口音转换器模型的原型。该转换器模型由一个编码器和一个解码器组成。编码器模型将带口音的输入转换为无口音形式。解码器模型将无口音形式转换为由输入口音标签指定的带口音形式。该转换器原型保留了声调并舍弃了输出音频中的细节。编码器-解码器结构展示了作为有效口音转换器的潜力。还提出了未来改进方案,以解决解码器输出中细节丢失的问题。

关键词

引用

@article{arxiv.2008.03359,
  title  = {A New Approach to Accent Recognition and Conversion for Mandarin Chinese},
  author = {Lin Ai and Shih-Ying Jeng and Homayoon Beigi},
  journal= {arXiv preprint arXiv:2008.03359},
  year   = {2020}
}

备注

11 pages, 7 figures, and 10 tables