中文

MAGIC:基于地图引导的少样本音视频声学建模

计算机视觉与模式识别 2024-05-24 v1

摘要

少样本音视频声学建模旨在以少量观测在任意位置合成房间脉冲响应。为了充分利用提供的少量观测数据以实现准确的声学建模,我们提出一种*基于地图引导*的框架,通过构建场景的声学相关视觉语义特征图。视觉特征保留与声音相关的语义细节,而地图提供声音传播的显式结构规律,这对建模环境声学具有重要价值。因此,我们提取观察的像素级语义特征并投影到顶视图地图上,即**观察语义图**。该图包含各点之间的相对位置信息以及与每个点相关的语义特征信息。然而,由少量观察在地图上提取的有限信息不足以理解和建模整个场景。我们通过扩散特征并预测观察语义图来生成**场景语义图**。场景语义图然后通过基于Transformer的编码器-解码器与回声编码相互作用,以预测任意说话人-听者查询对的RIR。广泛的在Matterport3D和Replica数据集上的实验验证了我们框架的有效性。

关键词

引用

@article{arxiv.2405.13860,
  title  = {MAGIC: Map-Guided Few-Shot Audio-Visual Acoustics Modeling},
  author = {Diwei Huang and Kunyang Lin and Peihao Chen and Qing Du and Mingkui Tan},
  journal= {arXiv preprint arXiv:2405.13860},
  year   = {2024}
}

备注

17 pages, 12 pages for main paper, 5 pages for supplementary