中文

利用音视频一致性与部分监督进行空间音频生成

声音 2021-05-04 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

人类通过双耳听到的不同声音感知丰富的听觉体验。以双耳音频录制的视频尤其模拟了人类接收环境声的方式。然而,大量视频仅含单声道音频,因缺乏环境信息会降低用户体验。为解决此问题,我们提出一种音频空间化框架,利用音频与视觉组件间的关系将单声道视频转换为双耳视频。通过在音频与视觉模态中保持左右一致性,我们的学习策略可视为一种自监督学习技术,并减轻了训练时对大量带真值双耳音频数据的视频数据的依赖。在基准数据集上的实验证实了我们所提框架在半监督与全监督场景下的有效性,消融研究与可视化进一步支持我们将该模型用于音频空间化。

关键词

引用

@article{arxiv.2105.00708,
  title  = {Exploiting Audio-Visual Consistency with Partial Supervision for Spatial Audio Generation},
  author = {Yan-Bo Lin and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2105.00708},
  year   = {2021}
}

备注

AAAI'21