以全神经网络源分离、计数与说话人日志系统应对真实含噪混响会议
音频与语音处理
2020-03-10 v1 机器学习
声音
摘要
自动会议分析是让智能设备等能够跟随并回应我们对话所必需的基础技术。为实现最优的自动会议分析,我们此前提出了一种全神经网络方法,以最优方式联合求解源分离、说话人日志与源计数问题(意指所有 3 项任务均可通过误差反向传播联合优化)。研究表明,该方法能很好处理模拟干净(无噪且无回声)的类对话数据,并与若干传统方法相比取得了非常好的性能。然而,这种全神经网络方法能否成功推广至含更多自发说话者、严重噪声与混响的更复杂真实会议数据,以及在此类场景下相较最先进(SOTA)系统的表现如何,尚不清楚。本文中,我们首先考虑提升全神经网络方法鲁棒性所需的实际问题,继而通过实验表明,即便在真实会议场景中,全神经网络方法也能实现有效的语音增强,并同时优于最先进系统。
引用
@article{arxiv.2003.03987,
title = {Tackling real noisy reverberant meetings with all-neural source separation, counting, and diarization system},
author = {Keisuke Kinoshita and Marc Delcroix and Shoko Araki and Tomohiro Nakatani},
journal= {arXiv preprint arXiv:2003.03987},
year = {2020}
}
备注
8 pages, to appear in ICASSP2020