基于图连接时序分类的音素识别
音频与语音处理
2025-09-09 v1 人工智能
摘要
自动音素识别(APR)系统通常使用通过音素到音素(G2P)系统从文本生成的伪音素级标注进行训练。这些G2P系统经常会为每个单词输出多个可能的发音,但标准的连接时序分类(CTC)损失无法在训练期间考虑这种歧义。本文将图时序分类(GTC)应用于APR场景。GTC允许从音素序列的图中进行训练,使模型能够将每个单词的多个发音视为有效的监督信息。我们在英语和荷兰语数据集上进行实验,结果表明,将每个单词的多个发音纳入训练损失可持续改善音素错误率,而基线使用CTC训练则不行。这些结果表明,将发音变异性整合到损失函数中,是训练基于G2P噪声监督APR系统的有前景的策略。
引用
@article{arxiv.2509.05399,
title = {Graph Connectionist Temporal Classification for Phoneme Recognition},
author = {Henry Grafé and Hugo Van hamme},
journal= {arXiv preprint arXiv:2509.05399},
year = {2025}
}
备注
Accepted to the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2025)