一种轻量级实时双声道语音增强模型与空间线索保持
声音
2025-01-09 v3 人工智能
音频与语音处理
摘要
双声道语音增强 (BSE) 旨在联合提高听筒设备接收的噪声信号的语音质量和可理解性,同时保留目标的空间线索以实现自然的聆听。现有方法常在降噪能力与空间线索保持准确性之间进行权衡,并在复杂声学场景中具有较高的计算需求。本文提出了一种基于学习的轻量级双声道复合卷积网络 (LBCCN),其在滤除低频段后保持其余频段,展现出卓越的降噪性能。此外,我们的方法显式地融合了声道间相对声学传递函数的估计,以确保空间线索的真实性和语音清晰度。结果表明,所提出的 LBCCN 在固定说话人条件下,能够实现与最先进方法相当的降噪性能,但计算成本更低,且具有一定的空间线索保持能力。可重复使用的代码和音频示例已公开于 https://github.com/jywanng/LBCCN。
引用
@article{arxiv.2409.12444,
title = {A Lightweight and Real-Time Binaural Speech Enhancement Model with Spatial Cues Preservation},
author = {Jingyuan Wang and Jie Zhang and Shihao Chen and Miao Sun},
journal= {arXiv preprint arXiv:2409.12444},
year = {2025}
}