CabinSep:基于 IR 增强掩码的 MVDR 用于分布式异构阵列的实时车内语音分离
声音
2025-09-03 v1 人工智能
人机交互
音频与语音处理
摘要
从多个说话人中分离重叠语音对于有效的人车交互至关重要。本文提出了一种轻量级的基于神经掩码的最小方差无失真响应(MVDR)语音分离方法 CabinSep,以降低后端自动语音识别(ASR)模型中的语音识别错误。我们的贡献有三方面:首先,我们利用通道信息提取空间特征,从而改进了语音和噪声掩码的估计。其次,我们在推理过程中采用 MVDR,减少了语音失真,使其对 ASR 更友好。第三,我们引入了一种结合模拟与真实录制脉冲响应(IR)的数据增强方法,改善了区域边界处的说话人定位,进一步降低了语音识别错误。CabinSep 的计算复杂度仅为 0.4 GMACs,在真实录制数据集上,与最先进的 DualSep 模型相比,其语音识别错误率相对降低了 17.5%。演示请见:https://cabinsep.github.io/cabinsep/。
引用
@article{arxiv.2509.01399,
title = {CabinSep: IR-Augmented Mask-Based MVDR for Real-Time In-Car Speech Separation with Distributed Heterogeneous Arrays},
author = {Runduo Han and Yanxin Hu and Yihui Fu and Zihan Zhang and Yukai Jv and Li Chen and Lei Xie},
journal= {arXiv preprint arXiv:2509.01399},
year = {2025}
}
备注
Accepted by Interspeech 2025