在混响环境中以双流架构探索时域深度吸引子网络
音频与语音处理
2021-05-07 v4 声音
摘要
深度吸引子网络(DANs)利用判别性嵌入与说话人吸引子进行语音分离。相较于基于排列不变训练(PIT)的方法,DANs定义了深度嵌入空间,并对每个时频(T-F)单元提供更精细的表示。然而,已观察到若直接将DANs部署于混响环境中,其在信号质量上的提升有限。继时域分离网络在干净混合语音上取得成功之后,我们提出一种具有双流卷积网络的时域DAN(TD-DAN),其在说话人数量可变条件下高效执行去混响与分离任务。TD-DAN的说话人编码流(SES)被训练以在嵌入空间中建模说话人信息。语音解码流(SDS)接受来自SES的说话人吸引子,并学习从谱-时表示中估计早期反射。同时,额外的聚类损失用于弥合真实与估计吸引子之间的差距。实验在Spatialized Multi-Speaker Wall Street Journal (SMS-WSJ)数据集上进行。早期反射与无混响及混响信号进行比较,随后被选为学习目标。实验结果表明,TD-DAN在混响双说话人/三说话人评估集上取得了9.79/7.47 dB尺度不变信失真比(SI-SDR)增益,分别超越基线DAN与卷积时域音频分离网络(Conv-TasNet) 1.92/0.68 dB与0.91/0.47 dB。
引用
@article{arxiv.2007.00272,
title = {Exploring the time-domain deep attractor network with two-stream architectures in a reverberant environment},
author = {Hangting Chen and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2007.00272},
year = {2021}
}
备注
Neural Networks (2021)