中文

SIRUP:基于扩散的导向向量虚拟上置换,用于一阶全向声定位

音频与语音处理 2026-02-23 v1 声音 信号处理

摘要

本文提出了由更少信道球形麦克风阵列捕获的导向向量的虚拟上置换。这一挑战传统上通过从一阶全向音频 (FOA) 数据中恢复声源的方向和信号,然后使用基于物理的声学模拟器渲染更高阶全向音频 (HOA) 数据来实现。然而,这种方法难以处理源定位空间直接性与 FOA 全向音频数据空间分辨率之间的相互依赖性。我们的方法称为 SIRUP,采用潜在扩散模型架构。具体而言,使用变分自编码器 (VAE) 来学习 HOA 数据在潜在空间中的紧凑编码,然后训练扩散模型以条件化 FOA 数据生成 HOA 嵌入。实验结果表明,SIRUP 在导向向量上置换、源定位和语音去噪方面相较于 FOA 系统取得了显著的改进。

关键词

引用

@article{arxiv.2602.17732,
  title  = {SIRUP: A diffusion-based virtual upmixer of steering vectors for highly-directive spatialization with first-order ambisonics},
  author = {Emilio Picard and Diego Di Carlo and Aditya Arie Nugraha and Mathieu Fontaine and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2602.17732},
  year   = {2026}
}