中文

RASR2:用于通用序列到序列语音识别的 RWTH ASR 工具包

计算与语言 2023-10-19 v1 声音 音频与语音处理

摘要

现代公开 ASR 工具通常为训练各种序列到序列(S2S)模型提供丰富支持,但仅为开放词表场景的解码提供相当简单的支持。对于封闭词表场景,支持词法约束解码的公开工具通常仅面向经典 ASR,或不支持所有 S2S 模型。为消除诸如建模单元选择等研究可能性的这一限制,我们在本工作中提出 RASR2,一个以研究为导向、用 C++ 实现的通用 S2S 解码器。它为各种 S2S 模型、语言模型、标注单元/拓扑以及神经网络架构提供了很强的灵活性/兼容性。基于一个广义搜索框架,它针对开放与封闭词表场景均提供高效解码,并丰富支持不同搜索模式与设置。我们在 switchboard 和 Librispeech 语料库上通过广泛实验对 RASR2 进行了评估。我们的源代码已在线公开。

关键词

引用

@article{arxiv.2305.17782,
  title  = {RASR2: The RWTH ASR Toolkit for Generic Sequence-to-sequence Speech Recognition},
  author = {Wei Zhou and Eugen Beck and Simon Berger and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2305.17782},
  year   = {2023}
}

备注

accepted at Interspeech 2023