混合与定位:定位混合声源
计算机视觉与模式识别
2022-11-29 v1
摘要
我们提出了一种在视觉场景中同时定位多个声源的方法。该任务要求模型既能将混合声音分离为单个声源,又能将它们与视觉信号关联起来。我们的方法受Jabri等人对比随机游走的启发,通过一种联合公式同时解决这两个任务。我们创建一个图,其中图像和分离的声音对应于节点,并训练一个随机游走者以高返回概率在不同模态的节点之间转移。该游走的转移概率由我们模型学习的视听相似度度量决定。我们通过对乐器和人类语音的实验表明,我们的模型可以成功定位多个声音,性能优于其他自监督方法。项目网站:https://hxixixh.github.io/mix-and-localize
引用
@article{arxiv.2211.15058,
title = {Mix and Localize: Localizing Sound Sources in Mixtures},
author = {Xixi Hu and Ziyang Chen and Andrew Owens},
journal= {arXiv preprint arXiv:2211.15058},
year = {2022}
}
备注
CVPR 2022