基于双路径结构保留空间线索的实时立体声语音增强
音频与语音处理
2024-02-02 v1
摘要
我们提出了一种实时多通道语音增强算法,该算法能够保持包含两个语音源的立体声录音的空间线索。认识到每个源具有独特的空间信息,我们的方法利用双路径结构,通过应用特定源的共带增益,确保空间线索在增强过程中不受影响。该方法还无缝集成了预训练的单声道语音增强模型,无需在立体声输入上重新训练。通过空间波束成形实现立体声混合的源分离,其中每个源的导向向量使用增强后的输出信号进行自适应更新。这确保了对空间信息的准确跟踪。最终的立体声输出通过合并增强源的空间图像得到,其有效性不严重依赖于波束成形的分离性能。该算法以 10 ms 帧实时运行,具有 40 ms 的前瞻。评估结果表明,在完全重叠和稀疏重叠的混合中,该方法在增强语音和保留空间线索方面均有效。
引用
@article{arxiv.2402.00337,
title = {Real-time Stereo Speech Enhancement with Spatial-Cue Preservation based on Dual-Path Structure},
author = {Masahito Togami and Jean-Marc Valin and Karim Helwani and Ritwik Giri and Umut Isik and Michael M. Goodwin},
journal= {arXiv preprint arXiv:2402.00337},
year = {2024}
}
备注
Accepted for ICASSP 2024, 5 pages