中文

具备可编程语音 AI 加速器的无线助听设备

声音 2025-10-23 v2 音频与语音处理

摘要

传统观点认为,由于流式深度学习模型的高计算需求,设计具有端侧语音 AI 模型的超紧凑、电池受限的无线助听设备极具挑战。语音 AI 模型需要连续、实时的音频处理,这带来了严格的计算与 I/O 约束。我们提出了 NeuralAids,一个完全端侧的无线助听设备语音 AI 系统,能够在紧凑、电池受限的设备上实现实时语音增强与降噪。我们的系统通过三项关键技术贡献,弥合了用于语音增强的 SOTA 深度学习与低功耗 AI 硬件之间的差距:1) 集成语音 AI 加速器的无线助听设备平台,用于高效的端侧流式推理;2) 为低延迟、高质量语音增强设计的优化双路径神经网络;3) 采用混合精度量化与量化感知训练的软硬件协同设计,以在严格功耗约束下实现实时性能。我们的系统实时处理 6 ms 音频块,实现 5.54 ms 的推理时间,同时功耗仅为 71.6 mW。在包括 28 名参与者用户研究的真实世界评估中,我们的系统在语音质量和噪声抑制方面优于先前的端侧模型,为能够在端侧完全增强听力的下一代智能无线助听设备铺平了道路。

关键词

引用

@article{arxiv.2503.18698,
  title  = {Wireless Hearables With Programmable Speech AI Accelerators},
  author = {Malek Itani and Tuochao Chen and Arun Raghavan and Gavriel Kohlberg and Shyamnath Gollakota},
  journal= {arXiv preprint arXiv:2503.18698},
  year   = {2025}
}