基于谱-空间协方差特征的 Ambisonics 录音子带声学参数盲估计
音频与语音处理
2025-01-14 v2 机器学习
声音
信号处理
摘要
估计频率变化的声学参数对于增强真实空间音频创作中的沉浸式感知至关重要。在本文中,我们提出了一种统一框架,利用一阶 Ambisonics(FOA)语音录音作为输入,盲估计 10 个频段中的混响时间(T60)、直达混响比(DRR)和清晰度(C50)。所提出的框架利用了一种名为谱-空间协方差向量(SSCV)的新特征,高效地表示 FOA 信号的时间、频谱和空间信息。我们的模型显著优于仅具有频谱信息的现有单通道方法,将所有三个声学参数的估计误差减少了一半以上。此外,我们引入了 FOA-Conv3D,一种新型后端网络,用于有效利用 SSCV 特征并结合 3D 卷积编码器。FOA-Conv3D 优于卷积神经网络(CNN)和循环卷积神经网络(CRNN)后端,在所有三个声学参数上实现了更低的估计误差并解释了更高的方差比例(PoV)。
引用
@article{arxiv.2411.03172,
title = {Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features},
author = {Hanyu Meng and Jeroen Breebaart and Jeremy Stoddard and Vidhyasaharan Sethu and Eliathamby Ambikairajah},
journal= {arXiv preprint arXiv:2411.03172},
year = {2025}
}
备注
Accepted by ICASSP2025