中文

基于空间感知多任务学习的语音分离

声音 2022-07-22 v1 人机交互 音频与语音处理

摘要

在新冠疫情期间,在线会议已成为我们生活中不可或缺的一部分。由于其便利性和广泛的覆盖面,这一趋势可能会持续下去。然而,来自其他家庭成员、室友、同事的背景噪声不仅降低了语音质量,还引发了严重的隐私问题。在本文中,我们开发了一种新颖的系统,称为基于空间感知多任务学习的分离(SAMS),用于在电话会议期间从目标用户处提取音频信号。我们的解决方案包含三个新颖组件:(i) 从用户语音和听不见的追踪声生成细粒度的位置嵌入,其中包含用户位置和丰富的多径信息,(ii) 使用多任务学习开发源分离神经网络,以联合优化源分离和位置,以及 (iii) 显著加速推理以提供实时保证。我们的测试床实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2207.10229,
  title  = {Spatial Aware Multi-Task Learning Based Speech Separation},
  author = {Wei Sun and Mei Wang and Lili Qiu},
  journal= {arXiv preprint arXiv:2207.10229},
  year   = {2022}
}