提升目标语音提取对注册语音变化的鲁棒性的策略
音频与语音处理
2022-06-17 v1 声音
信号处理
摘要
目标语音提取是一种利用预先录制的、表征目标说话人声音特征的注册语音从混合信号中提取目标说话人声音的技术。目标语音提取的一个主要困难在于处理“说话人内部”特征的变化,即目标语音与注册语音之间的特征不匹配。虽然大多数传统方法侧重于在给定一组注册语音时改善{\it 平均性能},但本文提出保证{\it 最差性能},我们认为这在实践中具有重要意义。在这项工作中,我们提出了一种称为最差注册语音信噪比失真比(SDR)的评估指标,以定量衡量对注册语音变化的鲁棒性。我们还引入了一种新颖的训练方案,旨在通过聚焦于使用提取表现不佳的困难注册案例进行训练,直接优化最坏情况性能。此外,我们研究了辅助说话人识别损失(SI-loss)作为另一种提升注册鲁棒性的有效性。实验验证表明,最差注册目标训练和 SI-loss 训练均能通过增强说话人可分辨性来提升对注册语音变化的鲁棒性。
引用
@article{arxiv.2206.08174,
title = {Strategies to Improve Robustness of Target Speech Extraction to Enrollment Variations},
author = {Hiroshi Sato and Tsubasa Ochiai and Marc Delcroix and Keisuke Kinoshita and Takafumi Moriya and Naoki Makishima and Mana Ihori and Tomohiro Tanaka and Ryo Masumura},
journal= {arXiv preprint arXiv:2206.08174},
year = {2022}
}
备注
5 pages, 2 figures, 3 tables Submitted to Interspeech 2022