DiffAU:基于扩散模型的 Ambisonics 上采样
音频与语音处理
2026-03-31 v2 声音
信号处理
摘要
空间音频通过再现 3D sound fields 来增强沉浸感, Ambisonics 提供了可扩展的格式以实现此目的. 虽然 first-order Ambisonics (FOA) 显著简化了 hardware-efficient acquisition and storage of sound fields, 相较于 high-order Ambisonics (HOA) 其低空间分辨率限制了现实感, 这凸显了 Ambisonics upscaling (AU) 作为增加 Ambisonics signals 阶数的必要方法. 在本工作中, 我们提出 DiffAU, 一个级联 AU 方法, 利用最新进展中的 diffusion models 并针对空间音频进行 novel adaptation, 从 FOA 生成 3 阶 Ambisonics. 通过学习数据 distributions, DiffAU 提供了一种 principled 的方法, 快速可靠地再现 HOA 在 various settings 中. 在 anechoic 条件下使用 multiple speakers 的实验中, 我们展示了 strong objective 和 perceptual 性能.
关键词
引用
@article{arxiv.2510.00180,
title = {DiffAU: Diffusion-Based Ambisonics Upscaling},
author = {Amit Milstein and Nir Shlezinger and Boaz Rafaely},
journal= {arXiv preprint arXiv:2510.00180},
year = {2026}
}