中文

NeuFA:基于神经网络且具有双向注意力机制的端到端强制对齐模型

声音 2022-04-01 v1 音频与语音处理

摘要

尽管深度学习和端到端模型已在自动语音识别(ASR)与文本到语音(TTS)合成中得到广泛应用并展现出优越性,但当前最先进的强制对齐(FA)模型仍基于隐马尔可夫模型(HMM)。HMM 对上下文信息的利用有限,且采用长流程开发,导致误差累积与性能不佳。受注意力机制在 ASR 和 TTS 中捕捉长期上下文信息及学习对齐能力之启发,我们提出了一种基于神经网络的端到端强制对齐器 NeuFA,其中新颖的双向注意力机制发挥了关键作用。NeuFA 通过在所提双向注意力机制中从共享注意力矩阵学习双向对齐信息,将 ASR 与 TTS 任务的对齐学习集成于统一框架中。对齐信息从学到的注意力权重中提取,并以多任务学习方式由 ASR、TTS 和 FA 任务共同优化。实验结果表明了我们所提模型的有效性:在词级别上,测试集平均绝对误差从 25.8 ms 降至 23.7 ms;在音素级别上,从 17.0 ms 降至 15.7 ms,优于最先进的基于 HMM 的模型。

关键词

引用

@article{arxiv.2203.16838,
  title  = {NeuFA: Neural Network Based End-to-End Forced Alignment with Bidirectional Attention Mechanism},
  author = {Jingbei Li and Yi Meng and Zhiyong Wu and Helen Meng and Qiao Tian and Yuping Wang and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2203.16838},
  year   = {2022}
}

备注

Accepted by ICASSP 2022