ChunkFormer:基于分块掩码式Conformer的长时段语音转录模型
声音
2025-02-21 v1 音频与语音处理
摘要
在工业规模部署语音识别模型时,硬件资源管理面临重大挑战,尤其是对于音频时长数小时的转录任务。尽管大型 Conformer 模型功能强大,但仅能在80GB GPU上处理15分钟的音频。此外,变长输入会导致标准批处理产生过多填充,增加资源消耗和执行时间。为此,我们引入ChunkFormer,一种利用相对右上下文进行分块处理的高效语音识别模型,使其能够在低内存 GPU上处理长时段音频转录。ChunkFormer在80GB GPU上可处理最长达16小时的音频,超过当前最先进的FastConformer 1.5倍,同时通过最高可达7.7%的绝对词错误率降低提升长时段转录性能,同时在较短任务上保持与Conformer相当的准确性。通过消除标准批处理中的填充需求,ChunkFormer的掩码式批处理技术在批处理过程中将执行时间和内存使用降低超过3倍,显著降低了广泛语音识别系统(尤其是面向实际应用的模型)的GPU资源成本。
引用
@article{arxiv.2502.14673,
title = {ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription},
author = {Khanh Le and Tuan Vu Ho and Dung Tran and Duc Thanh Chau},
journal= {arXiv preprint arXiv:2502.14673},
year = {2025}
}
备注
Accepted to ICASSP 2025