中文

利用有限量带标点训练数据的端到端联合标点与归一化 ASR

计算与语言 2025-07-22 v3 声音 音频与语音处理

摘要

联合标点与归一化自动语音识别(ASR)旨在输出带标点与大小写以及不带标点与大小写的转录文本。由于大多数 ASR 语料中缺乏配对的语音与带标点文本数据,该任务仍具挑战性。我们提出两种利用有限带标点数据训练端到端联合标点与归一化 ASR 系统的方法。第一种方法使用语言模型将归一化训练转录文本转换为带标点转录文本,这在域外测试数据上取得更好性能,相对标点-大小写感知词错误率(PC-WER)最高降低 17%。第二种方法使用受输出类型约束的单解码器,相较 Whisper-base 取得 42% 的相对 PC-WER 降低,且相较仅标点模型的归一化输出取得 4% 的相对(归一化)WER 降低。此外,我们提出的模型证明了仅使用少至 5% 的带标点训练数据、以适度(绝对 2.42%)的 PC-WER 上升为代价实现联合 ASR 系统的可行性。

关键词

引用

@article{arxiv.2311.17741,
  title  = {End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data},
  author = {Can Cui and Imran Ahamad Sheikh and Mostafa Sadeghi and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:2311.17741},
  year   = {2025}
}