中文

更长(未必)更强:用于增强语音识别与翻译的标点长序列训练

音频与语音处理 2024-09-10 v1 计算与语言

摘要

本文提出了一种用于训练语音识别和翻译任务的序列到序列模型的新方法。传统方法是在仅包含小写或部分标点与大小写 (PnC) 句子的短片段上训练模型,而我们提出在包含带有正确标点与大小写的完整句子的更长话语上进行训练。我们通过使用 FastConformer 架构实现了这一点,该架构允许利用全注意力机制训练序列长达 60 秒的 10 亿参数模型。然而,虽然使用 PnC 训练提高了整体性能,但我们观察到在各种评估设置下,当训练序列超过 40 秒时,准确率会出现平台期。我们提出的方法显著提高了标点与大小写的准确率,在 Earnings-21 和 Earnings-22 基准测试上显示出 25% 的相对词错误率 (WER) 提升。此外,在更长的音频片段上进行训练提高了语音识别和翻译基准测试中的整体模型准确率。模型权重和训练代码已通过 NVIDIA NeMo 开源。

关键词

引用

@article{arxiv.2409.05601,
  title  = {Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation},
  author = {Nithin Rao Koluguri and Travis Bartley and Hainan Xu and Oleksii Hrinchuk and Jagadeesh Balam and Boris Ginsburg and Georg Kucsko},
  journal= {arXiv preprint arXiv:2409.05601},
  year   = {2024}
}

备注

Accepted at SLT 2024