音视频分割的隐式反事实学习
计算机视觉与模式识别
2025-07-29 v1
摘要
音视频分割(AVS)旨在基于音频线索对视频中的物体进行分割。现有的AVS方法主要设计用于增强交互效率,但关注不足模态表示的差异和不平衡。为此,我们提出一种隐式反事实框架(ICF),以实现无偏的跨模态理解。由于缺乏语义,异构表示可能导致错误匹配,尤其是在具有歧义视觉内容或来自多个音频源的干扰的复杂场景中。我们引入多粒度隐式文本(MIT),涉及视频、段和帧级别,作为建立模态共享空间的桥梁,减少模态差距并提供先验指导。视觉内容携带更多信息,通常占主导地位,从而在决策中边缘化音频特征。为缓解知识偏好,我们提出语义反事实(SC),在潜在空间中学习正交表示,生成多样化的反事实样本,从而避免复杂功能设计和显式修改文本结构或属性所引入的偏差。我们进一步提出协作分布感知对比学习(CDCL),纳入事实-反事实和跨模态对比,以对齐表示,促进团结和解耦。对三个公开数据集的大量实验表明,所提出的方法实现了最先进的性能。
引用
@article{arxiv.2507.20740,
title = {Implicit Counterfactual Learning for Audio-Visual Segmentation},
author = {Mingfeng Zha and Tianyu Li and Guoqing Wang and Peng Wang and Yangyang Wu and Yang Yang and Heng Tao Shen},
journal= {arXiv preprint arXiv:2507.20740},
year = {2025}
}
备注
Accepted by ICCV 2025