用于边缘设备轻量级语音增强的反向注意力机制
音频与语音处理
2025-09-23 v1 声音
摘要
本文介绍了一种用于实时语音增强的轻量级深度学习模型,旨在资源受限的设备上高效运行。该模型利用紧凑的架构,在不牺牲性能的情况下实现快速推理。关键贡献包括在 U-Net 架构中注入基于软注意力的注意力门控,该架构以其在分割任务上的良好表现而闻名,并针对 GPU 进行了优化。实验评估表明,该模型在语音质量和可懂度指标(如 PESQ 和词错误率(WER))上取得了有竞争力的表现,相较于同等大小的基线模型有所提升。与未增强的波形相比,我们实现了 6.24% 的 WER 改善和 0.64 的 PESQ 分数提升。
引用
@article{arxiv.2509.16705,
title = {Reverse Attention for Lightweight Speech Enhancement on Edge Devices},
author = {Shuubham Ojha and Felix Gervits and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2509.16705},
year = {2025}
}