中文

基于 TTS 实现的 ASR 架构间领域迁移分析:分离目标域与声学条件

核实验 2025-08-14 v1 高能物理 - 实验

摘要

我们分析了在领域不匹配情况下的自动语音识别(ASR)建模选择,比较经典模块化和新型序列到序列(seq2seq)架构。跨不同的 ASR 架构,我们检视了包括标签单元、上下文长度和拓扑结构在内的多种建模选择。为隔离语言领域效应与声学变化,我们使用在 LibriSpeech 上训练的语音合成系统合成目标域音频。我们采用目标域 n-gram 和神经语言模型进行领域适应,而无需重新训练声学模型。据我们了解,这是首次在领域迁移下,对比优化的 ASR 系统在最先进架构下的控制性比较,为其泛化性提供了见解。结果显示,在领域迁移下,特定的建模选择而非解码器架构选择或经典模块化与新型 seq2seq 模型之间的差异,才是影响性能的关键因素。

关键词

引用

@article{arxiv.2508.09867,
  title  = {First direct access to the $\rho^0$p interaction via correlation studies at the LHC},
  author = {ALICE Collaboration},
  journal= {arXiv preprint arXiv:2508.09867},
  year   = {2025}
}

备注

21 pages, 2 captioned figures, 4 tables, authors from page 15, submitted to Physical Review Letters, figures at http://alice-publications.web.cern.ch/node/12746