BAVS:融合基础知识的自举视听分割
计算机视觉与模式识别
2023-08-22 v1
摘要
给定音视频对,视听分割(AVS)旨在通过预测像素级图来定位发声源。先前方法假设音频信号中的每个声音成分在图像中总有对应的视觉部分。然而,该假设忽略了真实场景中离屏声音和背景噪声常污染音频录制这一事实。它们对为 AVS 模型建立音频与视觉信号间一致语义映射带来显著挑战,从而阻碍精确的声音定位。本工作中,我们提出一种通过融入多模态基础知识的两阶段自举视听分割框架。简而言之,我们的 BAVS 旨在通过显式建立视听对应关系,消除分割中背景噪声或离屏声音的干扰。在第一阶段,我们采用分割模型从视觉数据中定位潜在发声物体,而不受污染音频信号影响。同时,我们利用基础音频分类模型辨识音频语义。考虑到音频基础模型提供的音频标签含有噪声,将物体掩码与音频标签关联并非易事。因此,在第二阶段,我们提出视听语义整合策略(AVIS)来定位真实发声物体。此处,我们基于声音与物体类别间的层次对应关系构建视听树。随后,通过追溯视听树来检验定位物体与分类音频标签间的标签并发性。借助 AVIS,我们可有效分割真实发声物体。大量实验证明了我们的方法在 AVS 数据集上的优越性,尤其在含背景噪声的场景中。项目主页见 https://yenanliu.github.io/AVSS.github.io/。
引用
@article{arxiv.2308.10175,
title = {BAVS: Bootstrapping Audio-Visual Segmentation by Integrating Foundation Knowledge},
author = {Chen Liu and Peike Li and Hu Zhang and Lincheng Li and Zi Huang and Dadong Wang and Xin Yu},
journal= {arXiv preprint arXiv:2308.10175},
year = {2023}
}