基于音频引导的鲁棒音视频分割——视觉收敛对齐
声音
2025-03-18 v1 计算机视觉与模式识别
摘要
精准地基于音视频线索定位可听见物体,是音视频分割的核心目标。大多数先前方法侧重于空间或时间的多模态建模,却忽略了来自模糊音视频对应关系的挑战,如相邻视觉相似但声学不同的物体以及物体发声状态的频繁变化。因此,这些方法可能难以可靠地关联音视频线索,导致分割过度或不足。为解决这些限制,我们提出一种新框架,包含两个主要组件:音频引导的模态对齐(AMA)模块和不确定性估计(UE)模块。与通过全局注意力机制对音视频线索进行无差异关联不同,AMA 在多个组别中执行音视频交互,并根据其对音频线索的响应性将组别特征整合为紧凑表示,从而有效引导模型注意力聚焦于音频相关区域。利用对比学习,AMA 进一步通过将对音频响应强的特征视为正样本、响应较弱的特征视为负样本来区分发声区域和静止区域。此外,UE 整合空间和时间信息,以识别因声音状态频繁变化导致的高不确定性区域,通过降低这些区域的置信度来减少预测误差。实验结果表明,我们的方法在准确性上优于现有 SOTA 方法,尤其在传统方法难以可靠分割的挑战场景中表现突出。
引用
@article{arxiv.2503.12847,
title = {Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment},
author = {Chen Liu and Peike Li and Liying Yang and Dadong Wang and Lincheng Li and Xin Yu},
journal= {arXiv preprint arXiv:2503.12847},
year = {2025}
}
备注
Accepted by CVPR2025