学习按空间区域分离语音
声音
2022-07-18 v2 机器学习
多媒体
音频与语音处理
摘要
我们考虑双耳应用(如耳机和助听器)中的音频语音分离问题。当今的神经网络表现极为出色(用 2 个麦克风分离 个声源),但它们假设已知或固定的最大声源数 K。此外,当今的模型以监督方式训练,使用由通用声源、环境和人头形状合成的训练数据。本文旨在放宽这两个约束,代价是对问题定义做轻微改动。我们观察到,当接收到的混合信号包含过多声源时,按区域分离它们仍然有用,即隔离用户头部周围每个锥形扇区来的信号混合。这需要学习每个区域的细粒度空间特性,包括人的头部所带来的信号失真。我们提出了一个两阶段自监督框架,其中耳机听到的语音先被预处理以提取相对干净的个性化信号,然后用于训练区域级分离模型。结果显示出有前景的性能,凸显了相对于通用监督方法的个性化的重要性。(音频样本见项目网站:https://uiuc-earable-computing.github.io/binaural/)。我们相信该结果有助于选择性听觉、噪声消除和音频增强现实中的实际应用。
引用
@article{arxiv.2207.04203,
title = {Learning to Separate Voices by Spatial Regions},
author = {Zhongweiyang Xu and Romit Roy Choudhury},
journal= {arXiv preprint arXiv:2207.04203},
year = {2022}
}
备注
Accepted to ICML 2022. For associated audio samples, see https://uiuc-earable-computing.github.io/binaural