用于声音增强的无监督改进 MVDR 波束形成
声音
2024-10-02 v4 音频与语音处理
摘要
神经网络近期已成为声音分离的主导方法。其良好性能依赖于孤立录音的大型数据集。对于语音和音乐,孤立的单声道数据易于获取;然而在多声道情况以及大多数其他声音类别中并非如此。多声道方法有可能优于单声道方法,因为它们可以利用空间和频谱特征,但训练数据的缺乏仍是一个挑战。我们提出了无监督最小方差无失真响应(UIMVDR),通过无监督训练和波束形成,使多声道分离能够利用自然场景中的单声道数据。结果表明,UIMVDR 泛化良好,与监督模型相比提升了分离性能,尤其是在监督数据有限的情况下。通过使用在线可获取的数据,它还减少了为多声道方法收集数据所需的工作量。
引用
@article{arxiv.2406.06310,
title = {Unsupervised Improved MVDR Beamforming for Sound Enhancement},
author = {Jacob Kealey and John Hershey and François Grondin},
journal= {arXiv preprint arXiv:2406.06310},
year = {2024}
}
备注
Proceedings of INTERSPEECH 2024