中文

利用辅助自编码损失分离可变数量的源

音频与语音处理 2020-08-19 v2 机器学习 声音

摘要

许多近期的源分离系统被设计为从混合中分离固定数量的源。在源激活模式未知的情况下,此类系统要么必须调整输出数量,要么从有效输出中辨识无效输出。迭代分离方法因能灵活决定输出数量而在学界获得大量关注,然而(1)它们通常依赖长期信息来决定迭代的停止时刻,这使其难以在因果设定下运行;(2)当估计的源数量与实际数量不同时,它们缺乏“容错”机制。本文提出一种简单的训练方法——辅助自编码置换不变训练(A2PIT),以缓解这两个问题。A2PIT假定固定数量的输出,并利用辅助自编码损失迫使无效输出成为输入混合的副本,且在推断阶段以完全无监督的方式检测无效输出。实验结果表明,A2PIT能够提升针对不同说话人人数的分离性能,并有效检测混合中的说话人数量。

关键词

引用

@article{arxiv.2003.12326,
  title  = {Separating Varying Numbers of Sources with Auxiliary Autoencoding Loss},
  author = {Yi Luo and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2003.12326},
  year   = {2020}
}

备注

Interspeech 2020