一种用于端到端语音增强的全卷积神经网络方法
声音
2018-07-24 v1 机器学习
音频与语音处理
机器学习
摘要
本文将描述一种解决鸡尾酒会问题的新方法,该方法依赖于全卷积神经网络(FCN)架构。FCN以含噪音频数据作为输入,并执行非线性滤波操作,在输出端产生目标语音的干净音频数据。我们的方法针对一个特定说话人学习模型,然后能够从嘈杂背景噪声中提取该说话人的声音。实验结果表明,该方法能够泛化到新说话人,并对不同信噪比的新噪声环境具有鲁棒性。该方法的一个潜在应用是用于助听器。预训练模型可以快速针对个人的家庭成员和亲密朋友进行微调,并部署到助听器中以辅助听者在噪声环境中的聆听。
引用
@article{arxiv.1807.07959,
title = {A Fully Convolutional Neural Network Approach to End-to-End Speech Enhancement},
author = {Frank Longueira and Sam Keene},
journal= {arXiv preprint arXiv:1807.07959},
year = {2018}
}