中文

面向基于标记的语音识别的前端标记增强

声音 2026-02-05 v1 计算与语言 音频与语音处理

摘要

语音信号的离散化表示是各种语音应用(包括自动语音识别(ASR)和语音语言模型)中连续特征的高效替代方案。然而,这些表示(例如来自自监督学习(SSL)语音模型聚类输出的语义或音素标记)容易受到环境噪声影响,可能降低后端任务性能。本文引入一个前端系统,用于从噪声语音中估计干净语音标记,并在使用语义标记的ASR后端上进行评估。我们考虑四种基于输入/输出域的增强模型:波到波、标记到标记、连续SSL特征到标记、以及波到标记。这些模型独立于ASR后端训练。CHiME-4数据集上的实验表明,波到标记增强在前端表现最佳。更重要的是,它大多数情况下优于基于连续SSL特征的ASR系统。

关键词

引用

@article{arxiv.2602.04217,
  title  = {Frontend Token Enhancement for Token-Based Speech Recognition},
  author = {Takanori Ashihara and Shota Horiguchi and Kohei Matsuura and Tsubasa Ochiai and Marc Delcroix},
  journal= {arXiv preprint arXiv:2602.04217},
  year   = {2026}
}

备注

Accepted at ICASSP 2026