AV-RIR:音视觉房间脉冲响应估计
声音
2024-04-25 v2 计算机视觉与模式识别
摘要
房间脉冲响应(RIR)的准确估计能够捕捉环境的声学特性,对语音处理和 AR/VR 应用十分重要。我们提出 AV-RIR,一种新颖的多模态多任务学习方法,可根据给定的混响语音信号及其对应环境的视觉线索准确估计 RIR。AV-RIR 基于一种新颖的神经网络编解码器(neural codec)架构,该架构有效捕捉环境几何与材料属性,并通过多任务学习将语音去混响作为辅助任务来求解。我们还提出 Geo-Mat 特征,将材料信息增强到视觉线索中,以及 CRIP,通过图像到 RIR 检索将估计 RIR 中的后期混响分量提升 86%。实证结果表明,AV-RIR 在定量上优于以往的仅音频和仅视觉方法,在各种声学指标上实现 36%–63% 的 RIR 估计改进。此外,它在人类评估中也获得更高的偏好分数。作为辅助收益,AV-RIR 去混响后的语音在各种口语处理任务中与最先进方法表现相当,并在真实世界 AVSpeech 数据集上优于混响时间误差分数。合成混响语音和增强语音的定性示例可在 https://www.youtube.com/watch?v=tTsKhviukAE 查看。
引用
@article{arxiv.2312.00834,
title = {AV-RIR: Audio-Visual Room Impulse Response Estimation},
author = {Anton Ratnarajah and Sreyan Ghosh and Sonal Kumar and Purva Chiniya and Dinesh Manocha},
journal= {arXiv preprint arXiv:2312.00834},
year = {2024}
}
备注
Accepted to CVPR 2024