中文

ReZero:区域可定制声音提取

音频与语音处理 2023-09-01 v1 人工智能 声音

摘要

我们提出区域可定制声音提取(ReZero),一种用于多通道区域级声音提取(R-SE)任务的通用灵活框架。R-SE 任务旨在提取特定用户定义空间区域内的所有活跃目标声音(例如人类语音),这与通常假设盲分离或固定、预定义空间区域的传统及现有任务不同。空间区域可定义为角度窗口、球体、锥体或其他几何图案。作为 R-SE 任务的解决方案,所提出的 ReZero 框架包括(1)不同类型空间区域的定义,(2)区域特征提取与聚合方法,以及(3)专为 R-SE 任务设计的带分裂 RNN(BSRNN)模型的多通道扩展。我们针对不同的麦克风阵列几何结构、不同类型的空间区域以及不同系统配置的全面消融研究设计了实验。在模拟和真实录制数据上的实验结果均证明了 ReZero 的有效性。演示可在 https://innerselfm.github.io/rezero/ 获取。

关键词

引用

@article{arxiv.2308.16892,
  title  = {ReZero: Region-customizable Sound Extraction},
  author = {Rongzhi Gu and Yi Luo},
  journal= {arXiv preprint arXiv:2308.16892},
  year   = {2023}
}

备注

13 pages, 11 figures