中文

学习按空间区域分离语音

声音 2022-07-18 v2 机器学习 多媒体 音频与语音处理

摘要

我们考虑双耳应用(如耳机和助听器)中的音频语音分离问题。当今的神经网络表现极为出色(用 2 个麦克风分离 4+4+ 个声源),但它们假设已知或固定的最大声源数 K。此外,当今的模型以监督方式训练,使用由通用声源、环境和人头形状合成的训练数据。本文旨在放宽这两个约束,代价是对问题定义做轻微改动。我们观察到,当接收到的混合信号包含过多声源时,按区域分离它们仍然有用,即隔离用户头部周围每个锥形扇区来的信号混合。这需要学习每个区域的细粒度空间特性,包括人的头部所带来的信号失真。我们提出了一个两阶段自监督框架,其中耳机听到的语音先被预处理以提取相对干净的个性化信号,然后用于训练区域级分离模型。结果显示出有前景的性能,凸显了相对于通用监督方法的个性化的重要性。(音频样本见项目网站:https://uiuc-earable-computing.github.io/binaural/)。我们相信该结果有助于选择性听觉、噪声消除和音频增强现实中的实际应用。

关键词

引用

@article{arxiv.2207.04203,
  title  = {Learning to Separate Voices by Spatial Regions},
  author = {Zhongweiyang Xu and Romit Roy Choudhury},
  journal= {arXiv preprint arXiv:2207.04203},
  year   = {2022}
}

备注

Accepted to ICML 2022. For associated audio samples, see https://uiuc-earable-computing.github.io/binaural