N-HANS:介绍奥格斯堡神经整体音频增强系统
声音
2019-12-02 v2 音频与语音处理
摘要
N-HANS 是一个用于真实场景音频增强的 Python 工具包,包括语音、音乐和通用音频的去噪、分离以及选择性噪声或声源抑制。这些功能基于两个共享相同架构但分别训练的神经网络模型实现。这些模型由残差块堆叠组成,每个残差块以额外的语音或环境噪声录音为条件,以适应现实生活中不同的未见过的说话人或环境。除 Python API 外,我们还向研究人员和开发者提供了命令行接口,二者的文档均位于 https://github.com/N-HANS/N-HANS。实验结果表明,N-HANS 取得了出色的性能,并确保了其在真实音频与语音相关任务中的可靠使用,达到了极高的音频与语音质量。
引用
@article{arxiv.1911.07062,
title = {N-HANS: Introducing the Augsburg Neuro-Holistic Audio-eNhancement System},
author = {Shuo Liu and Gil Keren and Björn Schuller},
journal= {arXiv preprint arXiv:1911.07062},
year = {2019}
}
备注
5 pages including references