中文

基于DNN的说话人无关音视觉掩码估计用于语音分离

声音 2018-09-12 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

人类听觉皮层擅长选择性地抑制背景噪声以聚焦于目标说话人。已知大脑中的选择性注意过程会利用上下文中的可用音频与视觉线索,以更好地聚焦于目标说话人同时滤除其他噪声。在本研究中,我们提出了一种新颖的基于深度神经网络(DNN)的音视觉(AV)掩码估计模型。所提出的AV掩码估计模型在上下文中整合了音频与抗噪视觉特征的时间动态,以改进掩码估计与语音分离。为实现最优的AV特征提取与理想二值掩码(IBM)估计,采用了一种混合DNN架构,以利用堆叠长短期记忆(LSTM)网络与卷积LSTM网络的互补优势。在语音质量与可懂度方面的对比仿真结果表明,相较于仅音频与仅视觉的掩码估计方法,我们所提出的AV掩码估计模型在说话人相关与无关场景下均取得了显著的性能提升。

关键词

引用

@article{arxiv.1808.00060,
  title  = {DNN driven Speaker Independent Audio-Visual Mask Estimation for Speech Separation},
  author = {Mandar Gogate and Ahsan Adeel and Ricard Marxer and Jon Barker and Amir Hussain},
  journal= {arXiv preprint arXiv:1808.00060},
  year   = {2018}
}

备注

Accepted for Interspeech 2018, 5 pages, 4 figures