中文

用于视听发声物体定位的双重归一化多任务方法

计算机视觉与模式识别 2021-06-02 v1 声音 音频与语音处理

摘要

尽管已有若干关于无约束视频中视听声源定位的研究工作,但文献中尚未提出用于定量评估其性能的数据集与指标。为声源定位定义真值较为困难,因为声音产生的位置不限于声源物体范围,而是振动通过周围物体传播与扩散。因此我们提出新概念“发声物体”(Sounding Object)以减少声音视觉位置的歧义,使广泛声源的位置标注成为可能。借助新提出的定量评估指标,我们形式化了视听发声物体定位(AVSOL)问题。我们还通过手动标注知名视听事件(AVE)数据集的测试集创建了评估数据集(AVSOL-E 数据集)。为解决这一新 AVSOL 问题,我们提出一种称为双重归一化多任务(DNM)的新型多任务训练策略与架构,其将视听对应(AVC)任务与视频事件分类任务聚合为单一的视听相似度图。通过 DNM 高效利用两种监督信号,我们所提架构显著优于基线方法。

关键词

引用

@article{arxiv.2106.00180,
  title  = {Dual Normalization Multitasking for Audio-Visual Sounding Object Localization},
  author = {Tokuhiro Nishikawa and Daiki Shimada and Jerry Jun Yokono},
  journal= {arXiv preprint arXiv:2106.00180},
  year   = {2021}
}

备注

10 pages, 6 figures