中文

利用不流畅性检测增强自动语音识别模型

计算与语言 2024-09-18 v2 人工智能

摘要

语音不流畅性常见于对话与自发语音中。然而,标准自动语音识别(ASR)模型难以准确识别这些不流畅性,因为它们通常在流畅的转录文本上训练。当前研究主要侧重于检测转录文本中的不流畅性,忽略了它们在语音中的确切位置与持续时间。此外,以往工作通常需要模型微调,且仅处理有限类型的不流畅性。在本工作中,我们提出了一种仅推理的方法,以增强任意 ASR 模型检测开放集不流畅性的能力。我们首先证明 ASR 模型在转录语音不流畅性方面存在困难。其次,本工作提出了一种基于 \cite{kurzinger2020ctc} 的改进连接时序分类(CTC)强制对齐算法,用于预测词级时间戳,同时有效捕捉不流畅语音。此外,我们开发了一个模型,将时间戳之间的对齐间隙分类为包含不流畅语音或静音。该模型达到了 81.62% 的准确率与 80.07% 的 F1 分数。我们在一个包含不流畅性的数据集上测试了对齐间隙检测与分类的增强流水线。结果表明,我们捕捉到了 74.13% 最初被转录遗漏的词汇,展示了该流水线在下游任务中的潜力。

关键词

引用

@article{arxiv.2409.10177,
  title  = {Augmenting Automatic Speech Recognition Models with Disfluency Detection},
  author = {Robin Amann and Zhaolin Li and Barbara Bruno and Jan Niehues},
  journal= {arXiv preprint arXiv:2409.10177},
  year   = {2024}
}

备注

Accepted by SLT2024