分段模型与神经转导器建模的等价性:概念验证
计算与语言
2023-10-24 v2 音频与语音处理
摘要
随着自动语音识别(ASR)中直接模型的兴起,此前基于隐马尔可夫模型(HMM)的帧级声学建模已分化为多种建模架构,如编码器-解码器注意力模型、转导器模型和分段模型(直接 HMM)。转导器模型保持帧级模型定义,而分段模型直接在标签段层面上定义。基于(软)注意力的模型避免显式对齐,而转导器与分段方法在内部确实建模对齐,或通过分段假设,或更隐式地通过发出所谓的空白符号。在本文中,我们证明广泛使用的 RNN-Transducer 模型类与分段模型(直接 HMM)等价,因此具有相等的建模能力。结果表明,空白概率转化为段长概率,反之亦然。此外,我们提供了初步实验以研究解码与束剪枝,比较时间同步与标签/段同步搜索策略及其性质,并使用同一底层模型。
引用
@article{arxiv.2104.06104,
title = {Equivalence of Segmental and Neural Transducer Modeling: A Proof of Concept},
author = {Wei Zhou and Albert Zeyer and André Merboldt and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2104.06104},
year = {2023}
}
备注
accepted at Interspeech2021