用于六自由度声学表示的双四元数Ambisonics阵列
音频与语音处理
2022-12-16 v2 机器学习
声音
摘要
由于沉浸式音频体验与应用(如虚拟现实和增强现实)的普及,空间音频方法正受到越来越多的关注。为此,三维音频信号通常通过Ambisonics麦克风阵列获取,每个麦克风由四个胶囊组成,将声场分解为球谐函数。本文中,我们提出了一种通过两个一阶Ambisonics(FOA)麦克风阵列获取的空间声场的双四元数表示。音频信号被封装在一个双四元数中,利用四元数代数性质来发掘它们之间的相关性。这种具有6自由度(6DOF)的增强表示实现了对声场更精确的覆盖,从而带来更精准的声音定位与更具沉浸感的音频体验。我们在一个声音事件定位与检测(SELD)基准上评估了我们的方法。我们表明,得益于我们对声场的增强表示,我们的带有时间卷积块的双四元数SELD模型(DualQSELD-TCN)相对于实数与四元数值基线取得了更好的结果。完整代码见:https://github.com/ispamm/DualQSELD-TCN。
引用
@article{arxiv.2204.01851,
title = {Dual Quaternion Ambisonics Array for Six-Degree-of-Freedom Acoustic Representation},
author = {Eleonora Grassucci and Gioia Mancini and Christian Brignone and Aurelio Uncini and Danilo Comminiello},
journal= {arXiv preprint arXiv:2204.01851},
year = {2022}
}
备注
Paper accepted for publication in Elsevier Pattern Recognition Letters