中文

Speech Boosting:面向 TWS 耳机的低延迟实时语音增强

音频与语音处理 2024-09-30 v1 人工智能 声音 信号处理

摘要

本文介绍了一种专为真无线立体声(TWS)耳机设备端使用而设计的语音增强解决方案。该解决方案专门设计用于在嘈杂环境中支持对话,并开启主动降噪(ANC)。在此场景下,语音增强模型面临的主要挑战来自于限制设备端使用的计算复杂度,以及为保持实时对话而必须低于 3 ms 的延迟。为了解决这些问题,我们评估了几个关键设计要素,包括网络架构与域、损失函数设计、剪枝方法以及特定硬件优化。结果表明,与基线模型相比,我们在语音增强质量上取得了显著提升,同时降低了计算复杂度和算法延迟。

关键词

引用

@article{arxiv.2409.18705,
  title  = {Speech Boosting: Low-Latency Live Speech Enhancement for TWS Earbuds},
  author = {Hanbin Bae and Pavel Andreev and Azat Saginbaev and Nicholas Babaev and Won-Jun Lee and Hosang Sung and Hoon-Young Cho},
  journal= {arXiv preprint arXiv:2409.18705},
  year   = {2024}
}

备注

Accepted by Interspeech 2024