面向视觉引导双耳立体声生成的跨模态生成模型
声音
2023-11-15 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
双耳立体声音频通过模仿人耳接收声音的方式录制,为人们提供沉浸式听觉体验。现有方法利用自编码器并直接利用视觉空间信息合成双耳立体声,导致视觉引导的表征有限。我们首次提出一种视觉引导的生成对抗方法,用于从单声道音频生成双耳立体声音频。具体而言,我们开发了立体声音频生成模型(SAGM),其利用共享的时空视觉信息分别引导生成器与判别器工作。共享视觉信息在生成对抗阶段交替更新,使生成器和判别器在视觉共享的同时传递各自被引导的知识。所提方法学习双向互补视觉信息,促进了生成中视觉引导的表达。此外,空间感知是双耳立体声音频的关键属性,因此立体声空间感知的评估至关重要。然而,以往的度量指标未能衡量音频的空间感知。为此,首次提出了一种衡量音频空间感知的度量指标。该指标能够衡量时间维度上空间感知的大小与方向。进一步,鉴于其功能,在一定程度上可替代耗力的用户研究。所提方法在2个数据集和5个评估指标上取得了最先进的性能。定性实验与用户研究表明该方法生成了具有空间真实感的立体声音频。
引用
@article{arxiv.2311.07630,
title = {Cross-modal Generative Model for Visual-Guided Binaural Stereo Generation},
author = {Zhaojian Li and Bin Zhao and Yuan Yuan},
journal= {arXiv preprint arXiv:2311.07630},
year = {2023}
}