中文

IsoNet:复杂声学环境中的空间感知视听目标语音提取

声音 2026-05-18 v2 机器学习

摘要

目标语音提取在紧凑设备上仍然困难,因为单耳神经模型缺乏空间证据,且当麦克风孔径仅有几厘米时,经典波束形成器会丧失分辨能力。我们提出了 IsoNet,一种用于紧凑 4 麦克风阵列的用户可选的视听目标语音提取系统。IsoNet 在 U-Net 掩码估计网络内结合了复数多通道 STFT 特征、GCC-PHAT 空间线索、以人脸为条件的视觉嵌入以及辅助到达方向监督。三种课程学习变体在 25,000 个模拟的 VoxCeleb 混合语音上训练,并采用逐渐困难的 SNR 机制。在跨越 -1 至 10 dB SNR 的困难测试集上,IsoNet-CL1 实现了 9.31 dB 的 SI-SDR,比混合语音提升了 4.85 dB,PESQ 为 2.13,STOI 为 0.84。Oracle 延迟求和与 MVDR 波束形成器分别使相同的混合语音降低了 4.82 dB 和 6.08 dB 的 SI-SDRi,这表明所提出的基于学习的多模态条件化解决了一类传统空间滤波无效的场景。消融研究表明,视觉条件化、GCC-PHAT 特征和扩展延迟箱编码带来了一致的增益。结果在受控仿真下确立了紧凑阵列、可选人脸的语音提取基线,并指出了向真实部署迈进时仍存在的障碍,特别是相位重建、多干扰源混合以及仿真到真实的迁移。

关键词

引用

@article{arxiv.2605.14736,
  title  = {IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments},
  author = {Dinanath Padhya and Sajen Maharjan and Binita Adhikari and Ishwor Raj Pokharel},
  journal= {arXiv preprint arXiv:2605.14736},
  year   = {2026}
}

备注

8 pages