面向未见麦克风阵列的 Ambisonics 神经编码泛化(Gen-A)
音频与语音处理
2025-01-15 v1 机器学习
声音
摘要
使用深度神经网络(DNN)对麦克风阵列(MA)信号编码到 Ambisonics 空间音频格式可以超越某些已建立的常规方法的局限性,但现有的 DNN 基于方法需要为每个 MA 单独训练。本文提出了一种针对在训练期未看到的任意 MA 几何形状进行泛化的 DNN 编码方法。该方法以 MA 几何和 MA 信号为输入,并使用由独立几何和信号数据路径组成的多级编码器,其中几何特征在每个层次上为信号编码器提供信息。该方法在模拟的无声学和室内 reverberant 条件下进行了验证,分别使用一个和两个声源。结果表明,在干燥场景下,编码在整个频率范围内均优于常规编码方法,而在室内 reverberant 场景下,改进随频率而变化。
关键词
引用
@article{arxiv.2501.08047,
title = {Gen-A: Generalizing Ambisonics Neural Encoding to Unseen Microphone Arrays},
author = {Mikko Heikkinen and Archontis Politis and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2501.08047},
year = {2025}
}
备注
Accepted for publication in Proceedings of the 2025 IEEE International Conference on Acoustics, Speech and Signal Processing