中文

基于音视频上下文和对比学习的Binaural音频生成模型CCStereo

声音 2025-08-07 v2 计算机视觉与模式识别 音频与语音处理

摘要

Binaural音频生成(BAG)旨在使用视觉提示将单声道音频转换为立体声音频,需要深入理解空间和语义信息。然而,当前模型风险容易对房间环境过拟合,并丢失细粒度空间细节。本文提出了一种新的音视频Binaural生成模型,引入音视频条件归一化层,动态地对目标差异音频特征的均值和方差进行视觉上下文对齐,同时提出一种新的对比学习方法,通过从混洗的视觉特征中挖掘负样本来增强空间灵敏度。我们还介绍了一种高效利用测试时数据增强的方法以提升性能。我们的方法在FAIR-Play和MUSIC-Stereo基准测试上实现了最先进的生成精度。

关键词

引用

@article{arxiv.2501.02786,
  title  = {CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation},
  author = {Yuanhong Chen and Kazuki Shimada and Christian Simon and Yukara Ikemiya and Takashi Shibuya and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2501.02786},
  year   = {2025}
}