基于对比学习与深度模块化的语音分离
声音
2024-10-10 v4 计算与语言
音频与语音处理
摘要
当前单通道语音分离的最先进工具依赖于监督学习。这意味着它们必须处理排列问题,且受训练和推理所用说话人数量不匹配的影响。此外,其性能严重依赖高质量标注数据的存在。这些问题可通过采用完全无监督的语音分离技术得到有效解决。在本文中,我们使用对比学习建立帧的表示,然后将学到的表示用于下游深度模块化任务。具体地,我们通过实验证明,在语音分离中,同一说话人的不同帧可视为该说话人某一给定隐藏标准帧的增广。说话人的帧包含足够的韵律信息重叠,这是语音分离的关键。基于此,我们实现自监督学习以学习最小化属于给定说话人的帧间距离。学到的表示用于下游深度模块化任务中以根据说话人身份聚类帧。在 WSJ0-2mix 和 WSJ0-3mix 上对开发技术的评估显示,该技术在 WSJ0-2mix 中分别达到 20.8 和 21.0 的 SI-SNRi 与 SDRi;在 WSJ0-3mix 中分别达到 20.7 和 20.7 的 SI-SNRi 与 SDRi(原文如此)。其最大优势在于随着说话人数量增加,性能不会显著下降。
引用
@article{arxiv.2305.10652,
title = {Speech Separation based on Contrastive Learning and Deep Modularization},
author = {Peter Ochieng},
journal= {arXiv preprint arXiv:2305.10652},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2212.00369