AdVerb:视觉引导的音频去混响
计算机视觉与模式识别
2023-08-25 v1 多媒体
声音
音频与语音处理
摘要
我们提出 AdVerb,一种新颖的视听去混响框架,其除混响声音外还利用视觉线索来估计干净音频。尽管仅音频去混响是已被充分研究的问题,我们的方法融合了互补的视觉模态来执行音频去混响。给定录制混响声音信号的环境图像,AdVerb 采用一种新颖的几何感知跨模态 transformer 架构,该架构捕捉场景几何与视听跨模态关系,生成复理想比率掩码,将其应用于混响音频即可预测干净声音。我们方法的的有效性通过广泛的定量与定性评估得到证明。在三项下游任务——语音增强、语音识别与说话人验证上,我们的方法显著优于传统仅音频与视听基线,在 LibriSpeech test-clean 集上相对提升达 18%–82%。我们在 AVSpeech 数据集上也取得了高度满意的 RT60 误差分数。
引用
@article{arxiv.2308.12370,
title = {AdVerb: Visually Guided Audio Dereverberation},
author = {Sanjoy Chowdhury and Sreyan Ghosh and Subhrajyoti Dasgupta and Anton Ratnarajah and Utkarsh Tyagi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2308.12370},
year = {2023}
}
备注
Accepted at ICCV 2023. For project page, see https://gamma.umd.edu/researchdirections/speech/adverb