中文

基于图连接时序分类的音素识别

音频与语音处理 2025-09-09 v1 人工智能

摘要

自动音素识别(APR)系统通常使用通过音素到音素(G2P)系统从文本生成的伪音素级标注进行训练。这些G2P系统经常会为每个单词输出多个可能的发音,但标准的连接时序分类(CTC)损失无法在训练期间考虑这种歧义。本文将图时序分类(GTC)应用于APR场景。GTC允许从音素序列的图中进行训练,使模型能够将每个单词的多个发音视为有效的监督信息。我们在英语和荷兰语数据集上进行实验,结果表明,将每个单词的多个发音纳入训练损失可持续改善音素错误率,而基线使用CTC训练则不行。这些结果表明,将发音变异性整合到损失函数中,是训练基于G2P噪声监督APR系统的有前景的策略。

关键词

引用

@article{arxiv.2509.05399,
  title  = {Graph Connectionist Temporal Classification for Phoneme Recognition},
  author = {Henry Grafé and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2509.05399},
  year   = {2025}
}

备注

Accepted to the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2025)