中文

SIREN:基于视觉的双耳音频空间重建

声音 2026-04-01 v1

摘要

双耳音频传递沉浸所必需的空间线索,但大多数消费视频由于采集限制而为单声道。我们提出了 SIREN,一个由视觉引导的单声道到双耳框架,明确预测左和右声道。基于 ViT 的编码器学习双头自注意力以生成共享场景图和端到端的左右注意力,取代手工制作的掩码。柔和的退火空间先验温和地引导早期左右定位,而两阶段、置信度加权的波形域融合(由单声道重建和耳间相位一致性引导)在聚合多裁剪和重叠窗口时抑制串扰。在 FAIR-Play 和 MUSIC-Stereo 上评估,SIREN 在时频和相位敏感指标上产生一致的增益,同时具有竞争力的信噪比。该设计是模块化和通用的,不需要任务特定标注,并可与标准音视频流水线集成。

关键词

引用

@article{arxiv.2603.29820,
  title  = {SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision},
  author = {Mingyeong Song and Seoyeon Ko and Junhyug Noh},
  journal= {arXiv preprint arXiv:2603.29820},
  year   = {2026}
}

备注

5 pages, 1 figure, to appear in ICASSP 2026