中文

混合与定位:定位混合声源

计算机视觉与模式识别 2022-11-29 v1

摘要

我们提出了一种在视觉场景中同时定位多个声源的方法。该任务要求模型既能将混合声音分离为单个声源,又能将它们与视觉信号关联起来。我们的方法受Jabri等人对比随机游走的启发,通过一种联合公式同时解决这两个任务。我们创建一个图,其中图像和分离的声音对应于节点,并训练一个随机游走者以高返回概率在不同模态的节点之间转移。该游走的转移概率由我们模型学习的视听相似度度量决定。我们通过对乐器和人类语音的实验表明,我们的模型可以成功定位多个声音,性能优于其他自监督方法。项目网站:https://hxixixh.github.io/mix-and-localize

关键词

引用

@article{arxiv.2211.15058,
  title  = {Mix and Localize: Localizing Sound Sources in Mixtures},
  author = {Xixi Hu and Ziyang Chen and Andrew Owens},
  journal= {arXiv preprint arXiv:2211.15058},
  year   = {2022}
}

备注

CVPR 2022