中文

面向学习不完美数据的 Token 加权 RNN-T

计算与语言 2024-06-27 v1 机器学习 声音 音频与语音处理

摘要

ASR 模型通常使用交叉熵准则进行训练,以增加目标 token 序列的概率。虽然对目标序列中所有 token 的概率进行优化是合理的,但可能希望弱化反映转录错误的 token。在本工作中,我们提出了一种 novel 的 token 加权 RNN-T 准则,通过在 RNN-T 目标中加入 token 特定权重来实现增强。该新目标用于减轻训练数据中转录错误导致的精度损失,这些错误自然出现在两种情境中:伪标签和人工标注错误。实验结果表明,使用我们的方法进行半监督学习可 consistently 提升精度,提升幅度达到 38%。我们还分析了不同 WER 水平下参考转录导致的精度降解情况,表明 token 加权 RNN-T 适用于克服这种降 degradation,能够恢复 64%-99% 的精度损失。

关键词

引用

@article{arxiv.2406.18108,
  title  = {Token-Weighted RNN-T for Learning from Flawed Data},
  author = {Gil Keren and Wei Zhou and Ozlem Kalinli},
  journal= {arXiv preprint arXiv:2406.18108},
  year   = {2024}
}