早期注意力稀疏化加速神经语音转录
机器学习
2025-06-23 v1 计算与语言
声音
音频与语音处理
摘要
基于Transformer的神经语音处理已取得最先进的性能。由于语音音频信号已知高度可压缩,本文寻求通过时域信号在神经编码阶段进行早期稀疏化,以发挥Transformer音频编码器自注意力机制可解释性的优势。我们以Whisper系列模型为基础,系统地在稀疏化阶段(特定编码层)和压缩比(稀疏度)的联合空间中进行架构搜索。我们发现,在保持<1%精度下降的前提下,最佳解决方案选择在早期编码阶段将隐藏状态稀疏化至40-60%稀疏度,从而在Nvidia GPU上实现最高达1.6倍的英文语音转录运行时加速,无需任何微调。
关键词
引用
@article{arxiv.2506.15912,
title = {Early Attentive Sparsification Accelerates Neural Speech Transcription},
author = {Zifei Xu and Sayeh Sharify and Hesham Mostafa and Tristan Webb and Wanzin Yazar and Xin Wang},
journal= {arXiv preprint arXiv:2506.15912},
year = {2025}
}