TF-MLPNet:面向听力助听器的微型实时神经语音分离
声音
2025-08-06 v1 机器学习
音频与语音处理
摘要
听力助听器上的语音分离可实现变革性的增强式听力功能。然而,现有最先进的语音分离网络无法在专为听力助听器设计的低功耗神经加速器上实现实时运行,因其计算资源有限。我们提出TF-MLPNet,首个能够在此类低功耗加速器上实现实时语音分离的网络,且在盲语音分离和目标语音提取方面超越现有流式模型。该网络在时频域中工作,利用全连接层在信道和频率维度交替处理频率序列,并在每个频率 bins 独立处理时间序列。实验结果表明,我们的混合精度量化感知训练(QAT)模型可在GAP9处理器上实时处理6 ms音频块,相较于先前语音分离模型实现3.5-4倍的运行时降低。
引用
@article{arxiv.2508.03047,
title = {TF-MLPNet: Tiny Real-Time Neural Speech Separation},
author = {Malek Itani and Tuochao Chen and Shyamnath Gollakota},
journal= {arXiv preprint arXiv:2508.03047},
year = {2025}
}
备注
The 6th Clarity Workshop on Improving Speech-in-Noise for Hearing Devices (Clarity 2025)