中文

在非自回归端到端 ASR 模型中实现识别同时的时间戳预测

声音 2023-01-31 v1 计算与语言 音频与语音处理

摘要

传统 ASR 系统利用帧级音素后验进行强制对齐(FA)并提供时间戳,而端到端 ASR 系统尤其是基于 AED 的系统缺乏此类能力。本文提出在非自回归 ASR 模型 Paraformer 中利用连续积分触发(CIF)机制,在识别的同时进行时间戳预测(TP)。针对 CIF 的触发位置偏置问题,我们采用包括触发延迟与静音插入的后处理策略。此外,我们提出使用 scaled-CIF 平滑 CIF 输出的权重,证明其对 ASR 与 TP 任务均有益。采用累积平均偏移(AAS)与说话人日志错误率(DER)衡量时间戳质量,并比较所提系统与传统混合强制对齐系统的这些指标。在人工标注时间戳测试集上的实验结果表明,所提优化方法显著提升 CIF 时间戳精度,使 AAS 与 DER 分别降低 66.7% 与 82.1%。与用相同数据训练的 Kaldi 强制对齐相比,优化后的 CIF 时间戳取得 12.3% 的相对 AAS 降低。

关键词

引用

@article{arxiv.2301.12343,
  title  = {Achieving Timestamp Prediction While Recognizing with Non-Autoregressive End-to-End ASR Model},
  author = {Xian Shi and Yanni Chen and Shiliang Zhang and Zhijie Yan},
  journal= {arXiv preprint arXiv:2301.12343},
  year   = {2023}
}