基于圆形麦克风阵列的神经声场编码用于多说话人场景
音频与语音处理
2024-09-17 v2
摘要
声场格式如Ambisonics具有播放设备布局无关性,适用于电子会议和虚拟现实等应用。传统Ambisonics编码方法常依赖球形麦克风阵列,以实现高效的声场捕获,但限制了其在实际场景中的灵活性。我们提出一种基于深度学习(DL)的方法,采用两阶段网络架构,将圆形麦克风阵列信号编码为二阶声场(SOA),用于多说话人环境。在此基础上,我们引入:(i)基于空间功率图的新型损失函数,以正则化Ambisonics信号的信道间相关性;(ii)一种信道置换技术,以解决使用水平圆形阵列编码垂直信息的歧义。在仿真语音和噪声数据集上的评估表明,我们的方法在时域和空间质量以及更高的声源定位精度方面 consistently 优于传统信号处理(SP)和基于DL的方法。binaural音频演示及可视化已发布于https://bridgoon97.github.io/NeuralAmbisonicEncoding/。
关键词
引用
@article{arxiv.2409.06954,
title = {Neural Ambisonic Encoding For Multi-Speaker Scenarios Using A Circular Microphone Array},
author = {Yue Qiao and Vinay Kothapally and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:2409.06954},
year = {2024}
}
备注
Submitted to ICASSP 2025