缩小深度吸引子网络的训练/推理差距
音频与语音处理
2019-11-07 v1 声音
摘要
本文通过缩小训练与推理之间的差距改进了深度吸引子网络(DANet)方法。在训练期间,DANet 依赖于从真实分离结果计算得到的吸引子。由于该信息在推理时不可用,吸引子必须被估计,通常借助 k-means 完成。这导致了两种不匹配:第一种不匹配源于使用具有欧氏范数的经典 k-means,而在训练期间掩码是使用点积相似度计算的。通过改用球形 k-means,我们可以证明已能提升 DANet 的性能。此外,我们展示可将 k-means 聚类完全纳入 DANet 训练中。这带来了无训练/推理差距的好处,并因此在 Wall Street Journal 语料库(WSJ0)上取得了 1.1dB 的尺度不变信号失真比(SI-SDR)提升。
引用
@article{arxiv.1911.02091,
title = {Closing the Training/Inference Gap for Deep Attractor Networks},
author = {Cyril Cadoux and Stefan Uhlich and Marc Ferras and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:1911.02091},
year = {2019}
}