谐波性在基于DNN与生物启发式单耳语音分离系统中起关键作用
音频与语音处理
2022-03-10 v1 人工智能
机器学习
声音
信号处理
摘要
深度学习的近期进展使语音分离模型取得了显著改进。尽管这些模型取得成功且适用性日益增强,但鲜有研究分析这些网络为执行分离所学习到的底层原理。在此,我们分析了谐波性在两个最先进的基于深度神经网络(DNN)的模型——Conv-TasNet和DPT-Net上的作用。我们使用自然语音混合物与轻微 manipulated 的非谐波语音(其谐波存在轻微频率抖动)来评估它们的性能。我们发现,若其中一个声源即使仅有轻微谐波抖动,性能也会显著恶化,例如,难以察觉的3%谐波抖动使Conv-TasNet的性能从15.4 dB降至0.70 dB。在非谐波语音上训练该模型并不能消除这种敏感性,反而导致在自然语音混合物上性能更差,使得非谐波性成为DNN模型中一种强大的对抗因素。此外,进一步分析表明,DNN算法与主要依赖时序线索而非谐波性来分离语音的生物启发式算法存在显著差异。
引用
@article{arxiv.2203.04420,
title = {Harmonicity Plays a Critical Role in DNN Based Versus in Biologically-Inspired Monaural Speech Segregation Systems},
author = {Rahil Parikh and Ilya Kavalerov and Carol Espy-Wilson and Shihab Shamma},
journal= {arXiv preprint arXiv:2203.04420},
year = {2022}
}
备注
5 pages, IEEE International Conference on Acoustics, Speech, & Signal Processing (ICASSP), 2022