面向噪声目标的基于RNN-Transducer的语音识别损失函数
音频与语音处理
2025-04-10 v1 人工智能
计算与语言
机器学习
声音
摘要
在工业流水线中,对语音识别系统进行噪声转录的训练是一个重大挑战,因为数据集庞大且难以确保每个实例都准确转录。在本工作中,我们引入了新的损失函数,以减轻RNN-Transducer模型中转录错误的影响。我们的星型Transducer损失通过在损失格中引入"跳过帧"转换,解决删除错误,恢复了超过90%的系统性能。Bypass-Transducer损失使用"跳过标记"转换来处理插入错误,恢复了超过60%的质量。最后,Target-Robust Transducer损失融合了这些方法,能够对任意错误提供稳健的性能。实验结果表明,Target-Robust Transducer损失显著提高了在噪声数据上的RNN-T性能,相较于良好转录数据,恢复了超过70%的质量。
关键词
引用
@article{arxiv.2504.06963,
title = {RNN-Transducer-based Losses for Speech Recognition on Noisy Targets},
author = {Vladimir Bataev},
journal= {arXiv preprint arXiv:2504.06963},
year = {2025}
}
备注
Final Project Report, Bachelor's Degree in Computer Science, University of London, March 2024