从运动中定位声音:联合学习声音方向与相机旋转
计算机视觉与模式识别
2023-08-22 v2 声音
音频与语音处理
摘要
当我们转动头部时,所感知的图像与声音会发生细微但几何一致的变化。在本文中,我们利用这些线索解决一个我们称之为“从运动中定位声音”(SLfM)的问题:联合估计相机旋转并定位声源。我们仅通过自监督学习来解决这些任务。一个视觉模型从一对图像中预测相机旋转,而一个音频模型从双耳声音中预测声源方向。我们训练这些模型以生成相互一致的预测。在测试时,这些模型可独立部署。为获得非常适合解决这一极具挑战性问题的特征表示,我们还提出了一种通过跨视角双耳化学习音视觉表示的方法:在给定另一视角的图像与声音的条件下,从单一视角估计双耳声音。我们的模型能在真实与合成场景上成功估计精确旋转,并以媲美最先进自监督方法的精度定位声源。项目主页:https://ificl.github.io/SLfM/
引用
@article{arxiv.2303.11329,
title = {Sound Localization from Motion: Jointly Learning Sound Direction and Camera Rotation},
author = {Ziyang Chen and Shengyi Qian and Andrew Owens},
journal= {arXiv preprint arXiv:2303.11329},
year = {2023}
}
备注
ICCV 2023. Project site: https://ificl.github.io/SLfM/