中文

Dual Mean-Teacher:一种用于音视频声源定位的无偏半监督框架

计算机视觉与模式识别 2024-03-06 v1 机器学习 多媒体 声音 音频与语音处理

摘要

音视频声源定位(AVSL)旨在给定配对音频片段的情况下,定位视频帧内的发声物体。现有方法主要依赖音视频对应关系的自监督对比学习。在没有任何边界框标注的情况下,这些方法难以实现精确定位,尤其是对于小物体,且存在边界模糊和误报问题。此外,朴素的半监督方法在充分利用大量未标记数据的信息方面表现不佳。本文提出了一种用于AVSL的新型半监督学习框架,即Dual Mean-Teacher(DMT),包含两个“教师-学生”结构以规避确认偏差问题。具体而言,在有限标记数据上预训练的两个教师模型通过其预测之间的一致性来过滤噪声样本,然后通过对其置信度图求交集来生成高质量的伪标签。对标记和未标记数据的充分利用以及所提出的无偏框架使DMT大幅优于当前最先进的方法,在Flickr-SoundNet和VGG-Sound Source上的CIoU分别达到90.4%和48.8%,在仅给定3%位置标注的情况下,相较于自监督和半监督方法分别获得了8.9%、9.6%和4.6%、6.4%的提升。我们还将该框架扩展到一些现有的AVSL方法中,并持续提升了其性能。

关键词

引用

@article{arxiv.2403.03145,
  title  = {Dual Mean-Teacher: An Unbiased Semi-Supervised Framework for Audio-Visual Source Localization},
  author = {Yuxin Guo and Shijie Ma and Hu Su and Zhiqing Wang and Yuhao Zhao and Wei Zou and Siyang Sun and Yun Zheng},
  journal= {arXiv preprint arXiv:2403.03145},
  year   = {2024}
}

备注

Accepted to NeurIPS2023