基于统一时频 Siamese-Unet 的单麦克风说话人提取
声音
2022-03-08 v1 人工智能
音频与语音处理
摘要
本文提出一种用于干净与噪声条件下说话人提取的统一时频方法。给定混合信号及参考信号,提取目标说话人的常见方法或在时域或在频域应用。在我们的方法中,我们提出一种同时使用两种表示的 Siamese-Unet 架构。Siamese 编码器在频域应用,分别推断噪声谱与参考谱的嵌入。拼接后的表示随后送入解码器以估计目标说话人的实部与虚部,再反变换至时域。模型以尺度不变信失真比(SI-SDR)损失训练,以利用时域信息。时域损失还以频域损失正则化以保留语音模式。实验结果表明,该统一方法不仅易于训练,而且相较于最先进(SOTA)盲源分离(BSS)方法以及常用说话人提取方法提供了更优结果。
引用
@article{arxiv.2203.02941,
title = {Single microphone speaker extraction using unified time-frequency Siamese-Unet},
author = {Aviad Eisenberg and Sharon Gannot and Shlomo E. Chazan},
journal= {arXiv preprint arXiv:2203.02941},
year = {2022}
}