边界框之声
计算机视觉与模式识别
2022-03-31 v1 多媒体
声音
音频与语音处理
摘要
在利用视觉信息进行声源分离的视听声源分离任务中,识别图像中的物体是分离声源前的关键步骤。然而,现有将声音分配给检测到的边界框的方法存在一个问题:其方法严重依赖于预训练的目标检测器。具体而言,使用这些现有方法时,需要预先确定所有可能产生声音的物体类别,并使用适用于所有这些类别的目标检测器。为应对该问题,我们提出一种完全无监督的方法,可同时学习检测图像中的物体并分离声源。由于我们的方法不依赖任何预训练检测器,因此无需任何额外标注即可适用于任意类别。此外,尽管是完全无监督的,我们发现我们的方法在分离精度上表现相当。
引用
@article{arxiv.2203.15991,
title = {The Sound of Bounding-Boxes},
author = {Takashi Oya and Shohei Iwase and Shigeo Morishima},
journal= {arXiv preprint arXiv:2203.15991},
year = {2022}
}
备注
6 pages, 5 figures, ICPR (International Conference on Pattern Recognition) 2022