中文

语音与文本长度相近的端到端语音识别

计算与语言 2025-10-14 v1

摘要

语音长度和文本长度的不匹配给自动语音识别(ASR)带来了挑战。在以往的研究中,已经采用了多种方法来对齐文本和语音,包括使用连接主义时间分类(CTC)。在早期工作中,引入了关键帧机制(KFDS),利用中间CTC输出来指导下采样并保留关键帧,但当将语音下采样到与文本相似的长度时,传统方法(CTC)未能适当地对齐语音和文本。在本文中,我们关注那些语音长度与相应文本长度紧密对齐的情况下的语音识别。为了解决这个问题,我们引入了两种对齐方法:a) 时间独立性损失(TIL)和b) 基于编辑距离的对齐交叉熵(AXE)损失。为了增强关键帧上的信息,我们通过应用权重并将关键帧与其上下文2帧求和来引入帧融合。在AISHELL-1和AISHELL-2数据集子集上的实验结果表明,所提出的方法优于先前的工作,并且实现了至少86%的帧数减少。

关键词

引用

@article{arxiv.2510.10453,
  title  = {End-to-end Speech Recognition with similar length speech and text},
  author = {Peng Fan and Wenping Wang and Fei Deng},
  journal= {arXiv preprint arXiv:2510.10453},
  year   = {2025}
}