中文

MMAudioReverbs:基于视频引导的声学建模用于消混响与房间脉冲响应估计

声音 2026-05-04 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

虽然最近的视频到音频 (V2A) 模型在合成语义上合理的声音方面取得了进展,但它们不显式地建模诸如混响或房间脉冲响应 (RIR) 的声学效应,因而对这些效应的可控性有限。然而,我们假设此类 V2A 模型隐式拥有关于空间声音与相应视觉线索之间关系的语义知识。本文我们重新审视一个 V2A 模型以实现上述目标,提出将预训练模型作为物理驱动房间声学处理的先验。基于最先进的 V2A 模型 MMAudio,我们提出 MMAudioReverbs,这是一个统一框架处理 i) 消混响和 ii) 房间脉冲响应 (RIR) 估计,无需修改网络结构,并在小型数据集上进行微调。实验结果显示,音频线索和视觉线索分别在不同类型的物理房间声学中各有优势。这表明基础 V2A 模型可用于物理驱动的房间声学分析。

关键词

引用

@article{arxiv.2605.00431,
  title  = {MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation},
  author = {Akira Takahashi and Ryosuke Sawata and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2605.00431},
  year   = {2026}
}

备注

Accepted to the CVPR 2026 Sight and Sound Workshop