自重混:基于分离与重混的无监督语音分离
音频与语音处理
2023-09-04 v2 声音
摘要
我们提出 Self-Remixing,一种新颖的自监督语音分离方法,它以无监督方式精炼预训练的分离模型。所提方法由一个打乱模块和一个求解模块组成,二者通过分离与重混过程共同成长。具体而言,打乱模块首先分离观测到的混合语音,并通过打乱与重混已分离信号来制作伪混合语音。随后求解模块分离伪混合语音并将分离出的信号重混回观测混合语音。求解模块以观测混合语音作为监督进行训练,而打乱模块的权重通过取与求解模块的移动平均来更新,从而生成失真更少的伪混合语音。我们的实验表明,在无监督设定下,Self-Remixing 以相同或更少的训练成本优于现有的基于重混的自监督方法。Self-Remixing 在半监督域适应中也优于基线,显示出在多种设定下的有效性。
引用
@article{arxiv.2211.10194,
title = {Self-Remixing: Unsupervised Speech Separation via Separation and Remixing},
author = {Kohei Saijo and Tetsuji Ogawa},
journal= {arXiv preprint arXiv:2211.10194},
year = {2023}
}
备注
Accepted by ICASSP2023, 5pages, 2figures, 2tables