中文

基于 Transformer 的端到端词汇重音检测方法

音频与语音处理 2019-11-13 v1 机器学习 声音 机器学习

摘要

主流的自动词汇重音检测方法是利用音素序列及其时间对齐边界将语音切分为音节段,然后从音节中提取特征并使用分类方法对词汇重音进行分类。然而,我们无法获得每个音素非常精确的时间边界,且必须设计一些音节段内的特征来对词汇重音进行分类。因此,我们提出一种使用 Transformer 序列到序列模型的端到端方法来估计词汇重音。为此,我们使用音频的特征序列及其带有词汇重音标记的音素序列来训练 Transformer 模型。在识别过程中,识别出的音素序列根据不带词汇重音标记的原始标准音素序列进行约束,但每个音素的词汇重音标记不受限制。我们在 Librispeech 的不同子集上训练模型,并在 TIMIT 和 L2-ARCTIC 数据集上进行词汇重音识别。对于所有子集,端到端模型均优于音节段分类方法。我们的方法在 TIMIT 数据集上可达到 6.36% 的音素错误率,优于其他研究中 7.2% 的错误率。

关键词

引用

@article{arxiv.1911.04862,
  title  = {An End-to-end Approach for Lexical Stress Detection based on Transformer},
  author = {Yong Ruan and Xiangdong Wang and Hong Liu and Zhigang Ou and Yun Gao and Jianfeng Cheng and Yueliang Qian},
  journal= {arXiv preprint arXiv:1911.04862},
  year   = {2019}
}

备注

Submission to ICASSP 2020