DEFORMER:耦合形变局部模式与全局上下文的鲁棒端到端语音识别
音频与语音处理
2025-06-19 v2 人工智能
摘要
卷积神经网络(CNN)通过利用局部时频模式极大地提升了语音识别性能。但传统 CNN 操作假设这些模式以对称且刚性的核出现。这引出一个问题:非对称核又如何?本研究说明,自适应视域能够发现比输入的固定视域更好与注意力耦合的局部特征。我们用可形变的对应模块替换 Conformer 架构中的深度可分离 CNN,称之为“Deformer”。通过分析我们性能最佳的模型,我们可视化了 Deformer 学到的局部感受野与全局注意力图,并展示了在语句层面上增强的特征关联。对所学核偏移的统计性分析提供了关于特征信息随网络深度变化的洞见。最后,仅替换编码器中一半的层,Deformer 在 WSJ eval92 集上相较 Conformer 基线在无语言模型时相对词错率提升 +5.6%,在有语言模型时提升 +6.4%。
引用
@article{arxiv.2207.01732,
title = {DEFORMER: Coupling Deformed Localized Patterns with Global Context for Robust End-to-end Speech Recognition},
author = {Jiamin Xie and John H. L. Hansen},
journal= {arXiv preprint arXiv:2207.01732},
year = {2025}
}
备注
Accepted to Interspeech 2022