基于稀疏测量引导的声场幅值估计:SF-Flow框架
音频与语音处理
2026-05-12 v1
摘要
从稀疏麦克风测量重建3D声场是一项基本且难以确定的课题,这我们通过声学传递函数(ATF)幅值估计来解决。ATF幅值包含物理空间的关键感知和声学属性,具有房间特征化和校正等应用。尽管近期的生成范式如流匹配(FM)在语音和音乐生成中取得了最前沿性能,但其在空间音频领域的潜力仍未得到充分探索。我们提出了一种新框架,将3D ATF幅值重建作为引导生成任务,采用由置换不变集合编码器条件化的3D U-Net。该体系结构支持来自任意数量稀疏输入的重建,同时利用FM的稳定和高效训练属性。实验结果表明,SF-Flow能够实现至\SI{1}{kHz}的准确重建,训练速度显著快于自编码器基线,并且随数据集大小显著提升。
引用
@article{arxiv.2605.10398,
title = {SF-Flow: Sound field magnitude estimation via flow matching guided by sparse measurements},
author = {Ege Erdem and Shoichi Koyama and Tomohiko Nakamura and Orchisama Das and Zoran Cvetković},
journal= {arXiv preprint arXiv:2605.10398},
year = {2026}
}