Onssen:一个开源语音分离与增强库
音频与语音处理
2019-11-05 v1 声音
摘要
语音分离是多说话人语音识别的一项基本任务。近来许多深度学习方法被提出并不断刷新最优性能。算法实现的缺乏限制了研究人员使用相同数据集进行比较。构建一个通用平台可使研究人员受益,便于轻松实现新颖的分离算法并在定制数据集上将其与现有算法比较。我们介绍“onssen”:一个开源语音分离与增强库。onssen 主要是一个面向深度学习分离与增强算法的库。它使用 LibRosa 和 NumPy 库进行特征提取,并使用 PyTorch 作为模型训练的后端。onssen 支持大多数基于时频掩码的分离算法(例如深度聚类、chimera net、chimera++ 等),也支持定制数据集。在本文中,我们描述了 onssen 中模块的功能,并展示了 onssen 实现的算法达到了原论文所报道的相同性能。
引用
@article{arxiv.1911.00982,
title = {Onssen: an open-source speech separation and enhancement library},
author = {Zhaoheng Ni and Michael I Mandel},
journal= {arXiv preprint arXiv:1911.00982},
year = {2019}
}
备注
Submitted to ICASSP 2020