HydraFormer:面向所有抽样率的单编码器
音频与语音处理
2024-08-09 v1 计算与语言
摘要
在自动语音识别中, 抽样对于应对各种实际场景至关重要。然而, 单一抽样率不足以解决各种现实情形, 常需训练和部署多个模型, 从而增加相关成本。为此, 我们提出了 HydraFormer, 包括基于 Conformer 的编码器 HydraSub 和基于 BiTransformer 的解码器。HydraSub 包含多个分支, 每个分支代表不同的抽样率, 允许在推理时根据具体使用场景灵活选择任意分支。HydraFormer 能够有效管理不同的抽样率, 显著降低训练和部署成本。在 AISHELL-1 和 LibriSpeech 数据集上的实验表明, HydraFormer 能够适应各种抽样率和语言, 同时保持高识别性能。此外, HydraFormer 在各种初始化条件下表现出卓越稳定性, 持续保持一致性能, 并展现出强大的迁移性, 可从预训练的单抽样率自动语音识别模型学习。
引用
@article{arxiv.2408.04325,
title = {HydraFormer: One Encoder For All Subsampling Rates},
author = {Yaoxun Xu and Xingchen Song and Zhiyong Wu and Di Wu and Zhendong Peng and Binbin Zhang},
journal= {arXiv preprint arXiv:2408.04325},
year = {2024}
}
备注
accepted by ICME 2024