AudioGS:基于频谱图的音频高斯溅用于声场重建
声音
2026-04-13 v1
摘要
空间音频是沉浸式虚拟体验的基础,但从稀疏观察数据合成高保真的 binaural 音频仍是一个重大挑战。现有方法通常依赖以视觉先验为条件的隐式神经表示,往往难以捕获细粒度的声学结构。灵感来自 3D 高斯溅 (3DGS),我们提出了 AudioGS,一种无视觉依赖的新型框架,通过频谱图将声场显式编码为一组音频高斯。AudioGS 将每个时频箱与一个音频高斯关联,该高斯配备双球面调和系数 (Spherical Harmonic, SH) 和衰减系数。对于目标姿态,我们通过评估 SH 场来捕获方向性,结合几何引导的距离衰减和相位校正,并重构波形。实验在 Replay-NVAS 数据集上进行,结果表明 AudioGS 成功捕获了复杂的空间线索,并优于最先进的视觉依赖基线方法。具体而言,与最佳视觉引导方法相比,AudioGS 将 magnitude 重建误差 (MAG) 降低超过 14%,感知质量指标 (DPAM) 降低约 25%。
引用
@article{arxiv.2604.08967,
title = {AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction},
author = {Chunhao Bi and Houqiang Zhong and Zhixin Xu and Li Song and Zhengxue Cheng},
journal= {arXiv preprint arXiv:2604.08967},
year = {2026}
}