Wavesplit:基于说话人聚类的端到端语音分离
音频与语音处理
2020-07-03 v2 计算与语言
机器学习
声音
机器学习
摘要
我们介绍 Wavesplit,一种端到端源分离系统。从单一混合信号中,模型推断每个源的表示,然后在给定推断表示的情况下估计每个源信号。该模型被训练为从原始波形联合执行这两项任务。Wavesplit 通过聚类推断一组源表示,从而解决分离的基本排列问题。对于语音分离,与先前工作相比,我们序列级的说话人表示对长时且具有挑战性的录音提供了更鲁棒的分离。Wavesplit 在 2 或 3 说话人的干净混合(WSJ0-2/3mix)以及含噪与混响设置(WHAM/WHAMR)上重新定义了最优水平。我们也在近期的 LibriMix 数据集上确立了新基准。最后,我们展示 Wavesplit 也适用于其他领域,通过从单一腹部心电图分离胎儿与母体心率。
引用
@article{arxiv.2002.08933,
title = {Wavesplit: End-to-End Speech Separation by Speaker Clustering},
author = {Neil Zeghidour and David Grangier},
journal= {arXiv preprint arXiv:2002.08933},
year = {2020}
}