通过注意力门控从背景中分离对话的听觉分离模型
声音
2019-05-28 v1 机器学习
音频与语音处理
摘要
我们提出了一种从包含未知数量声源的声音混合中分离出一组语音的模型。我们的注意力门控网络(AGN)使用可变注意力上下文来指定混合中哪些说话人是感兴趣的。注意力上下文由一个嵌入向量指定,该向量通过加性偏置修改神经网络的处理。学习个体说话人嵌入以分离单个说话人,而个体说话人嵌入的叠加用于分离说话人集合。我们首先在传统的单说话人分离任务上评估 AGN,并显示出相较可比模型 9% 的提升。然后,我们受人类在咖啡馆从背景嘈杂声中分离出感兴趣对话的能力启发,引入了一项新任务:从未知规模声音集合的混合中分离任意子集的语音。我们表明 AGN 是唯一能够解决该任务的模型,其性能仅比单说话人分离任务差 7%。
引用
@article{arxiv.1905.10751,
title = {Auditory Separation of a Conversation from Background via Attentional Gating},
author = {Shariq Mobin and Bruno Olshausen},
journal= {arXiv preprint arXiv:1905.10751},
year = {2019}
}