揭示与消除音视频分割中的偏差
计算机视觉与模式识别
2024-07-24 v1
摘要
社区研究人员已开发出一系列先进的音视频分割模型,以提高发声对象掩码的质量。虽然这些模型创建的掩码最初看起来可能是合理的,但偶尔会显示异常且具有错误 grounding 逻辑的现象。我们将其归因于现实世界固有的偏好和分布,这些偏好和分布比复杂的音视频 grounding 更简单,从而导致对重要模组信息的忽视。一般而言,这些异常现象往往比较复杂,无法直接进行系统性观察。本研究使用适当的合成数据对现象进行了首次分类和分析,依据异常来源将其归为两种类型"音频 priming 偏差"和"视觉先验"。对于音频 priming 偏差,通过为增强对不同强度和语义的音频敏感性,开发专门用于音频感知的感知模块,以感知潜在语义信息并将其整合到有限的查询集合中,即主动查询。此外,针对这些主动查询在transformer 解码器中的交互机制进行定制,以适应对音频语义之间交互调节的需求。对于视觉先验,探索了多种对比训练策略,通过包含偏差分支来优化模型,而无需更改模型的结构。在实验中,观察结果表明了现有模型偏差的存在及其影响。最后,通过对AVS基准的实验评估,我们展示了我们方法在处理这两种偏差方面的有效性,实现了在所有三个子集上取得竞争性能。
引用
@article{arxiv.2407.16638,
title = {Unveiling and Mitigating Bias in Audio Visual Segmentation},
author = {Peiwen Sun and Honggang Zhang and Di Hu},
journal= {arXiv preprint arXiv:2407.16638},
year = {2024}
}
备注
Accepted by ACM MM 24 (ORAL)