具有声音方向超分辨率的神经声场分解
声音
2022-10-25 v1 音频与语音处理
摘要
声场分解利用有限数量麦克风的信号作为输入来预测任意方向上的波形。声场分解是下游任务的基础,包括声源定位、声源分离和空间音频重放。传统的声场分解方法如 Ambisonics 具有有限的空间分解分辨率。本文提出一种基于学习的神经声场分解(NeSD)框架,利用任意位置处少数麦克风的麦克风单元录音,实现具有精细空间方向分辨率的声场分解。NeSD 系统的输入包括麦克风信号、麦克风位置和查询方向。NeSD 的输出包括查询位置的波形和存在概率。我们分别用不同的神经网络对 NeSD 系统建模,包括全连接、时间延迟和循环神经网络。我们表明,在语音、音乐和声音事件数据集上,NeSD 系统在声场分解和声源定位方面优于传统的 Ambisonics 和 DOANet 方法。演示可在 https://www.youtube.com/watch?v=0GIr6doj3BQ 获取。
引用
@article{arxiv.2210.12345,
title = {Neural Sound Field Decomposition with Super-resolution of Sound Direction},
author = {Qiuqiang Kong and Shilei Liu and Junjie Shi and Xuzhou Ye and Yin Cao and Qiaoxi Zhu and Yong Xu and Yuxuan Wang},
journal= {arXiv preprint arXiv:2210.12345},
year = {2022}
}
备注
12 pages