Sep-Stereo:通过关联源分离实现视觉引导的立体声生成
计算机视觉与模式识别
2020-07-21 v1 多媒体
声音
音频与语音处理
摘要
立体声音频是增强人类听觉体验不可或缺的元素。近期研究探索了利用视觉信息作为引导,在立体声监督下从单声道音频生成双耳或全景音频。然而,这种全监督范式存在固有缺陷:立体声音频的录制通常需要精密设备,成本高昂而难以普及。为克服这一挑战,我们提出利用大量可获取的单声道数据来促进立体声音频的生成。我们的关键观察是,视觉指示的音频分离任务同样将独立音频映射到其对应的视觉位置,这与立体声音频生成具有相似目标。我们将立体声生成与源分离整合到一个统一框架Sep-Stereo中,将源分离视为一种特定类型的音频空间化。具体而言,精心设计了一种新颖的关联金字塔网络架构用于音视频特征融合。大量实验表明,我们的框架在共享主干网络的同时,既能改善立体声音频生成结果,又能实现准确的声音分离。
引用
@article{arxiv.2007.09902,
title = {Sep-Stereo: Visually Guided Stereophonic Audio Generation by Associating Source Separation},
author = {Hang Zhou and Xudong Xu and Dahua Lin and Xiaogang Wang and Ziwei Liu},
journal= {arXiv preprint arXiv:2007.09902},
year = {2020}
}
备注
To appear in Proceedings of the European Conference on Computer Vision (ECCV), 2020. Code, models, and video results are available on our webpage: https://hangz-nju-cuhk.github.io/projects/Sep-Stereo