基于神经音频编解码器的喉镜麦克风实时语音增强
音频与语音处理
2025-08-06 v1
摘要
我们 presented a使用喉镜麦克风捕获语音的实时语音增强演示。该演示旨在展示从录音到基于深度学习的后处理的完整管线,用于在嘈杂环境中使用体导式麦克风捕获的语音。喉镜麦克风记录皮肤振动,这些振动自然衰减外部噪声,但这种鲁棒性以声音带宽受限为代价。为解决这一挑战,我们在Vibravox数据集上微调Kyutai的Mimi——一个支持实时推理的神经音频编解码器。我们将这种增强策略与最先进的模型进行比较,并证明其性能优越。推理运行在一个交互式界面上,允许用户切换增强、可视化频谱图,并监控处理延迟。
引用
@article{arxiv.2508.02974,
title = {Real-time speech enhancement in noise for throat microphone using neural audio codec as foundation model},
author = {Julien Hauret and Thomas Joubaud and Éric Bavu},
journal= {arXiv preprint arXiv:2508.02974},
year = {2025}
}
备注
2 pages, 2 figures