面向视频双耳音频生成的几何感知多任务学习
计算机视觉与模式识别
2021-11-23 v1 声音
音频与语音处理
摘要
双耳音频为人类听众提供沉浸式的空间声音体验,但大多数现有视频缺乏双耳音频录制。我们提出一种音频空间化方法,利用视频中的视觉信息将其单声道(单通道)音频转换为双耳音频。现有方法直接利用从视频帧中提取的视觉特征,而我们的方法显式解耦视觉流中的几何线索以指导学习过程。具体而言,我们开发了一个多任务框架,通过考虑潜在的房间脉冲响应、视觉流与声源位置的相干性,以及发声物体随时间变化的几何一致性,来学习用于双耳音频生成的几何感知特征。此外,我们引入了一个大型新视频数据集,其中为真实世界扫描环境模拟了逼真的双耳音频。在两个数据集上,我们证明了我们方法的有效性,其取得了最先进的(state-of-the-art, SOTA)结果。
引用
@article{arxiv.2111.10882,
title = {Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video},
author = {Rishabh Garg and Ruohan Gao and Kristen Grauman},
journal= {arXiv preprint arXiv:2111.10882},
year = {2021}
}
备注
Published in BMVC 2021, project page: http://vision.cs.utexas.edu/projects/geometry-aware-binaural/