中文

用于确定端到端 ASR 词表大小的基于微积分的框架

计算与语言 2026-05-15 v1 声音

摘要

在混合自动语音识别(ASR)系统中,词表大小是明确的,通常由语言中存在的音素、双音素或三音素的数量决定。相比之下,端到端 ASR 系统的词表(通常称为 token)源自用于训练的文本语料库。该词表的选择,更重要的是其大小,是训练端到端 ASR 系统的关键超参数。Byte Pair Encoding (BPE)、WordPiece 和 Unigram Language Model (ULM) 等分词算法将词表大小作为输入超参数,以生成 ASR 训练期间使用的子词。ESPNet 等流行工具包在其训练方案中提供了固定的词表大小,但文献中关于这些值是如何确定的几乎没有文档记录或讨论。近期工作 [1] 形式化了一种确定最适合端到端 ASR 的词表大小的方法,引入了一个将分词过程视为黑盒的代价函数框架。在本文中,我们在此基础上通过对训练数据进行曲线拟合,并运用微积分中的一阶和二阶导数检验原理,来正式估计词表大小超参数。我们通过在标准 Librispeech 语料库上应用该方法,展示了其效用与实用性,并表明词表大小超参数的最优选择能提升 ASR 的性能。本文的主要贡献在于形式化了一种确定最适合端到端 ASR 系统训练的词表大小的方法。

关键词

引用

@article{arxiv.2605.14427,
  title  = {A Calculus-Based Framework for Determining Vocabulary Size in End-to-End ASR},
  author = {Sunil Kumar Kopparapu},
  journal= {arXiv preprint arXiv:2605.14427},
  year   = {2026}
}

备注

8 pages, is an extension of the paper S. K. Kopparapu and A. Panda, A cost minimization approach to fix the vocabulary size in a tokenizer for an end-to-end ASR system, in Proceedings of the 2024 International Conference on Pattern Recognition, Kolkata, India, 2024