中文

端到端语音分离模型脆弱性的实证分析

音频与语音处理 2022-06-22 v1 人工智能 机器学习 声音 信号处理

摘要

端到端学习模型在执行语音分离方面展现出了卓越的能力。尽管它们在现实世界中有着广泛的应用,但人们对它们用于组合并进而分离单个说话人的机制知之甚少。已知谐波性是这些网络组合声源的关键线索,在这项工作中,我们对 ConvTasnet 和 DPT-Net 进行了深入调查,以分析它们如何对输入混合信号进行谐波分析。我们进行了消融研究,应用具有不同通带的低通、高通和带阻滤波器,以实证分析对分离最关键的谐波。我们还通过在合成混合信号中引入不连续性,研究了这些网络如何决定将哪个输出通道分配给估计的声源。我们发现端到端网络高度不稳定,在面对人类无法察觉的变形时表现不佳。将这些网络中的编码器替换为频谱图会导致整体性能下降,但稳定性会大幅提高。这项工作有助于我们理解这些网络依赖什么信息进行语音分离,并揭示了泛化错误的两个来源。它还将编码器定位为网络中导致这些错误的部分,从而允许利用专家知识或迁移学习进行重新设计。

关键词

引用

@article{arxiv.2206.09556,
  title  = {An Empirical Analysis on the Vulnerabilities of End-to-End Speech Segregation Models},
  author = {Rahil Parikh and Gaspar Rochette and Carol Espy-Wilson and Shihab Shamma},
  journal= {arXiv preprint arXiv:2206.09556},
  year   = {2022}
}

备注

Accepted at Interspeech 2022