弱监督音视频分割
计算机视觉与模式识别
2023-11-28 v1 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
音视频分割是一项具有挑战性的任务,旨在预测视频中声源的像素级掩码。先前工作采用了详尽的人工设计架构,并以无数像素级精确掩码作为监督。然而,这些像素级掩码代价高昂且并非在所有情况下都可得。本工作中,我们旨在将监督简化为实例级标注,即弱监督音视频分割。我们提出一种新颖的弱监督音视频分割框架,称为 WS-AVS,其可通过多尺度多实例对比学习来学习用于音视频分割的多尺度音视频对齐。在 AVSBench 上的大量实验证明了我们的 WS-AVS 在单源与多源场景的弱监督音视频分割中的有效性。
引用
@article{arxiv.2311.15080,
title = {Weakly-Supervised Audio-Visual Segmentation},
author = {Shentong Mo and Bhiksha Raj},
journal= {arXiv preprint arXiv:2311.15080},
year = {2023}
}