中文

基于 Canary 模型的词级时间戳生成用于自动语音识别与翻译

计算与语言 2025-05-22 v1 声音 音频与语音处理

摘要

我们提出一种数据驱动的方法,用于在 Canary 模型中实现词级时间戳预测。准确的时间戳信息对于诸如语音内容检索和带时间戳的字幕等众多下游任务至关重要。虽然传统混合系统和端到端(E2E)模型可能采用外部模块进行时间戳预测,但我们的做法无需独立的对齐机制。通过将 NeMo Forced Aligner(NFA)作为教师模型,生成词级时间戳并训练 Canary 模型直接预测时间戳。我们引入新的 <|timestamp|> 标记,使 Canary 模型能够为每个词预测开始和结束时间戳。我们的方法在四种语言上的精确率和召回率均在 80% 到 90% 之间,时间戳预测误差范围在 20 到 120 毫秒之间,WER 下降最小。此外,我们将系统扩展到自动语音翻译(AST)任务,实现约 200 毫秒的时间戳预测误差。

关键词

引用

@article{arxiv.2505.15646,
  title  = {Word Level Timestamp Generation for Automatic Speech Recognition and Translation},
  author = {Ke Hu and Krishna Puvvada and Elena Rastorgueva and Zhehuai Chen and He Huang and Shuoyang Ding and Kunal Dhawan and Hainan Xu and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2505.15646},
  year   = {2025}
}

备注

Accepted to Interspeech 2025