中文

在任意环境中随处聆听

计算机视觉与模式识别 2025-06-06 v2 人工智能 机器学习 声音 音频与语音处理

摘要

在混合现实应用中,空间环境中逼真的声学体验与视觉体验一样,对于实现真正的沉浸感至关重要。尽管在房间脉冲响应 (RIR) 估计的神经方法上取得了近期进展,但大多数现有方法仅限于其训练所用的单一环境,缺乏泛化到具有不同几何形状和表面材料的新房间的能力。我们旨在开发一个统一模型,能够以最少的额外测量重建任意环境的空间声学体验。为此,我们提出了 xRIR,一个用于跨房间 RIR 预测的框架。我们可泛化方法的核心在于将一个几何特征提取器(从全景深度图像中捕获空间上下文)与一个 RIR 编码器(仅从少量参考 RIR 样本中提取详细声学特征)相结合。为了评估我们的方法,我们引入了 ACOUSTICROOMS,一个包含来自 260 个房间的超过 300,000 个高保真模拟 RIR 的新数据集。实验表明,我们的方法大幅优于一系列基线方法。此外,我们通过在四个真实世界环境中评估我们的模型,成功进行了从仿真到现实的迁移,证明了我们方法的泛化能力和数据集的逼真度。

关键词

引用

@article{arxiv.2504.10746,
  title  = {Hearing Anywhere in Any Environment},
  author = {Xiulong Liu and Anurag Kumar and Paul Calamia and Sebastia V. Amengual and Calvin Murdock and Ishwarya Ananthabhotla and Philip Robinson and Eli Shlizerman and Vamsi Krishna Ithapu and Ruohan Gao},
  journal= {arXiv preprint arXiv:2504.10746},
  year   = {2025}
}

备注

CVPR 2025; Project Page: https://dragonliu1995.github.io/hearinganywhereinanyenvironment/