音频-视觉分割模型是否真正分割声音对象?
声音
2025-02-24 v2 人工智能
机器学习
多媒体
音频与语音处理
摘要
与传统视觉分割不同,音频-视觉分割(AVS)要求模型不仅识别和分割对象,还确定它们是否为声源。最近的 AVS 方法利用变换器架构和像 SAM 这样的强大基础模型,已在标准基准测试中取得令人瞩目的性能。然而,一个重要问题仍值得探讨:这些模型是否真正整合了音频-视觉线索来分割声音对象?本文在稳健 AVS 上下文中系统性地调查了这一问题。我们的研究揭示了当前方法的一个根本偏差:它们倾向于基于视觉显著性生成分割掩码,忽略音频背景。这一偏差导致在声音缺失或不相关时预测不可靠。为解决这一挑战,我们引入了 AVSBench-Robust,一个综合性基准,包含多样化的负面音频情景,包括静音、环境噪声和隐去声源。我们还提出了一种简单而有效的方法,结合负样本的平衡训练和分类器引导的相似性学习。我们的广泛实验表明,最先进的 AVS 方法在负面音频条件下始终无法做好工作,显示示了视觉偏差的普遍存在。相比之下,我们的方法在标准指标和鲁健性措施上实现了显著的改进,保持接近完美的假阳性率,同时保持高质量的分割性能。
引用
@article{arxiv.2502.00358,
title = {Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?},
author = {Jia Li and Wenjie Zhao and Ziru Huang and Yunhui Guo and Yapeng Tian},
journal= {arXiv preprint arXiv:2502.00358},
year = {2025}
}