中文

自动语音识别中的不同处理策略:分类早于集成晚

计算与语言 2026-01-13 v1

摘要

在语音语言建模中,两种架构占据前沿:Transformer和Conformer。然而,是否是由于处理策略的收敛性还是不同架构的归纳偏差导致了其相似的性能,尚不明了。我们引入了Architectural Fingerprinting,即一种探针框架,用于隔离架构对表示的影响,并将其应用于一套受控的24个预训练编码器(参数规模从39万到330万)。我们的分析揭示了不同层级:Conformer实施"早期分类"策略,在深度上比Transformer早29%解析音素类别,并在说话人性别上早16%的深度。相比之下,Transformer"晚期集成”,将音素、元音和持续时间编码推迟到深层(49-57%)。这些指纹表明设计启发法:Conformer的前置分类可能受益于低延迟流式处理,而Transformer的深层集成可能更适合需要丰富上下文和跨语料规范化的任务。

关键词

引用

@article{arxiv.2601.06972,
  title  = {Categorize Early, Integrate Late: Divergent Processing Strategies in Automatic Speech Recognition},
  author = {Nathan Roll and Pranav Bhalerao and Martijn Bartelds and Arjun Pawar and Yuka Tatsumi and Tolulope Ogunremi and Chen Shani and Calbert Graham and Meghan Sumner and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2601.06972},
  year   = {2026}
}

备注

3 figures, 9 tables