中文

异构分离一致性训练用于无监督语音分离的自适应

音频与语音处理 2022-08-09 v3 声音

摘要

近来,有监督语音分离取得巨大进展。然而,受限于有监督训练的本质,大多数现有分离方法需要真实源信号并在合成数据集上训练。这种对真实信号的依赖是有问题的,因为真实条件下通常无法获得真实信号。此外,在许多工业场景中,真实声学特性与模拟数据集中的偏差很大。因此,将有监督语音分离模型应用于实际应用时性能通常显著下降。为解决这些问题,本研究提出一种新颖的分离一致性训练,称为SCT,通过利用异构(结构不同但行为互补)模型获得的互补信息,以迭代方式挖掘真实世界无标签混合语音,改进跨域无监督语音分离。SCT遵循一个框架,使用两个异构神经网络(HNNs)为无标签真实语音混合产生高置信度伪标签。这些标签随后被更新,并用于精炼HNNs以产生更可靠的用于真实混合伪标注的一致性分离结果。为最大化利用不同分离网络间的大互补信息,进一步提出交叉知识自适应。结合模拟数据集,那些具有高置信度伪标签的真实混合随后被用于迭代更新HNN分离模型。此外,我们发现通过简单线性融合组合异构分离输出可进一步略微提升最终系统性能。

关键词

引用

@article{arxiv.2204.11032,
  title  = {Heterogeneous Separation Consistency Training for Adaptation of Unsupervised Speech Separation},
  author = {Jiangyu Han and Yanhua Long},
  journal= {arXiv preprint arXiv:2204.11032},
  year   = {2022}
}