ReZero:区域可定制声音提取
音频与语音处理
2023-09-01 v1 人工智能
声音
摘要
我们提出区域可定制声音提取(ReZero),一种用于多通道区域级声音提取(R-SE)任务的通用灵活框架。R-SE 任务旨在提取特定用户定义空间区域内的所有活跃目标声音(例如人类语音),这与通常假设盲分离或固定、预定义空间区域的传统及现有任务不同。空间区域可定义为角度窗口、球体、锥体或其他几何图案。作为 R-SE 任务的解决方案,所提出的 ReZero 框架包括(1)不同类型空间区域的定义,(2)区域特征提取与聚合方法,以及(3)专为 R-SE 任务设计的带分裂 RNN(BSRNN)模型的多通道扩展。我们针对不同的麦克风阵列几何结构、不同类型的空间区域以及不同系统配置的全面消融研究设计了实验。在模拟和真实录制数据上的实验结果均证明了 ReZero 的有效性。演示可在 https://innerselfm.github.io/rezero/ 获取。
引用
@article{arxiv.2308.16892,
title = {ReZero: Region-customizable Sound Extraction},
author = {Rongzhi Gu and Yi Luo},
journal= {arXiv preprint arXiv:2308.16892},
year = {2023}
}
备注
13 pages, 11 figures