相似音高说话人语音分离模型的鲁棒性
音频与语音处理
2024-07-23 v1 机器学习
信号处理
摘要
单通道语音分离是增强多说话人环境下语音识别系统的关键任务。本文考察了最新神经网络模型在说话人音高差最小化场景下的鲁棒性。基于 Ditter 和 Gerkmann 早期发现的 2018 年 Chimera++ 在相似音高条件下性能显著下降的结论,本研究将分析扩展至更近期且更复杂的神经网络模型。我们的实验表明,现代模型在匹配训练与测试条件下显著缩小了性能差距。然而,在不匹配条件下仍存在显著的性能差距,模型在大音高差时表现良好,但当说话人音高相似时表现较差。这些发现促使进一步研究语音分离模型对相似音高说话人及未见数据的通用性。
引用
@article{arxiv.2407.15749,
title = {Robustness of Speech Separation Models for Similar-pitch Speakers},
author = {Bunlong Lay and Sebastian Zaczek and Kristina Tesch and Timo Gerkmann},
journal= {arXiv preprint arXiv:2407.15749},
year = {2024}
}