基于视觉语言先验与3D声学环境建模的物理感知新视角声学合成
声音
2026-01-28 v1 多媒体
摘要
空间音频对于沉浸式体验至关重要,然而由于反射、衍射和材料吸收等复杂物理现象,新视角声学合成(NVAS)仍然具有挑战性。现有的基于单视角或全景输入的方法提高了空间保真度,但未能捕捉全局几何结构以及物体布局和材料属性等语义线索。为了解决这个问题,我们提出了Phys-NVAS,这是首个将空间几何建模与视觉语言语义先验相结合的物理感知NVAS框架。从多视角图像和深度图中重建全局3D声学环境,以估计房间大小和形状,增强声音传播的空间感知。同时,视觉语言模型提取物体、布局和材料的物理感知先验,捕捉超出几何范围的吸收和反射。一个声学特征融合适配器将这些线索统一为用于双耳生成的物理感知表示。在RWAVS上的实验表明,Phys-NVAS生成的双耳音频具有更高的真实感和物理一致性。
引用
@article{arxiv.2601.19712,
title = {Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling},
author = {Congyi Fan and Jian Guan and Youtian Lin and Dongli Xu and Tong Ye and Qiaoxi Zhu and Pengming Feng and Wenwu Wang},
journal= {arXiv preprint arXiv:2601.19712},
year = {2026}
}
备注
ICASSP 2026 Accept, Project page: https://physnvas.github.io/