中文

数据扩展的极限:多语言 ASR 中的子词利用与声学饱和

计算与语言 2025-10-28 v1

摘要

我们需要多少音频才能完全观察多语言 ASR 模型在不同语言中所学习的子词库的丰富性?多语言预训练中的数据不平衡会影响这些标记在推理期间的利用方式吗?我们通过分析 Whisper 在 49 种语言上的解码行为来回答这些问题。通过记录解码候选子词并跟踪其随时间的累积发现,我们研究了模型子词空间的利用模式。结果显示,发现的子词总数与语言的预训练小时数基本无关,表明数据不平衡对模型假设空间中的词汇多样性影响不大。子词发现率在各种语言中遵循一致的指数饱和模式,表明在此之后,额外的音频几乎不会激活新的子词。我们将这种收敛阈值称为声学饱和时间(AST)。进一步的分析揭示,秩-频率分布遵循更符合 Zipf-Mandelbrot 定律的模式,平均子词长度与资源水平呈正相关。此外,这些指标在拉丁脚本语言上表现更好,优于如西里尔文、日文/中文和希伯来文等书写系统的语言。总体而言,我们的研究表明,多语言 ASR 推理中的子词利用更多受制于语音的统计、类型学和正字法结构,而非训练数据的规模,这为更公平的语料库构建和跨语言评估提供了实证依据。

关键词

引用

@article{arxiv.2510.22492,
  title  = {The Limits of Data Scaling: Sub-token Utilization and Acoustic Saturation in Multilingual ASR},
  author = {Siyu Liang and Nicolas Ballier and Gina-Anne Levow and Richard Wright},
  journal= {arXiv preprint arXiv:2510.22492},
  year   = {2025}
}