迈向解决鸡尾酒会问题:构建带真实标注语音分离现实数据集的首个方法
声音
2024-08-29 v2 音频与语音处理
摘要
语音分离在人机交互、助听设备和自动会议转录等现实应用中非常重要。近年来,基于深度学习的解决方案取得了显著进展。事实上,尽管合成混合数据集不能代表真实世界的混合语音,但使用此类数据集的监督学习方法仍引起了大量关注。构建现实数据集的困难导致研究人员使用无监督学习方法,因为它们能够直接处理真实混合语音。无监督学习方法的结果仍不尽如人意。本文提出了一种创建带真实源信号的语音分离现实数据集的方法。设计现实数据集的主要挑战在于无法获得说话人信号的真实标注。为此,我们提出了一种同时录制两名说话人并获取各自真实标注的方法。我们给出了一种基于双向门控循环单元(BGRU)和聚类算法的深度学习模型来对现实数据集进行基准测试的方法。实验表明,我们提出的数据集将 SI-SDR(尺度不变信号失真比)提高了 1.65 dB,将 PESQ(语音质量感知评估)提高了约 0.5。我们还评估了该方法在麦克风与说话人不同距离下的有效性,发现它提高了所学模型的稳定性。
引用
@article{arxiv.2305.15758,
title = {Towards Solving Cocktail-Party: The First Method to Build a Realistic Dataset with Ground Truths for Speech Separation},
author = {Rawad Melhem and Assef Jafar and Oumayma Al Dakkak},
journal= {arXiv preprint arXiv:2305.15758},
year = {2024}
}