端到端语音分离模型脆弱性的实证分析
音频与语音处理
2022-06-22 v1 人工智能
机器学习
声音
信号处理
摘要
端到端学习模型在执行语音分离方面展现出了卓越的能力。尽管它们在现实世界中有着广泛的应用,但人们对它们用于组合并进而分离单个说话人的机制知之甚少。已知谐波性是这些网络组合声源的关键线索,在这项工作中,我们对 ConvTasnet 和 DPT-Net 进行了深入调查,以分析它们如何对输入混合信号进行谐波分析。我们进行了消融研究,应用具有不同通带的低通、高通和带阻滤波器,以实证分析对分离最关键的谐波。我们还通过在合成混合信号中引入不连续性,研究了这些网络如何决定将哪个输出通道分配给估计的声源。我们发现端到端网络高度不稳定,在面对人类无法察觉的变形时表现不佳。将这些网络中的编码器替换为频谱图会导致整体性能下降,但稳定性会大幅提高。这项工作有助于我们理解这些网络依赖什么信息进行语音分离,并揭示了泛化错误的两个来源。它还将编码器定位为网络中导致这些错误的部分,从而允许利用专家知识或迁移学习进行重新设计。
引用
@article{arxiv.2206.09556,
title = {An Empirical Analysis on the Vulnerabilities of End-to-End Speech Segregation Models},
author = {Rahil Parikh and Gaspar Rochette and Carol Espy-Wilson and Shihab Shamma},
journal= {arXiv preprint arXiv:2206.09556},
year = {2022}
}
备注
Accepted at Interspeech 2022