PRIMED:基于偏好竞争的自适应模态抑制用于指涉音视频分割
计算机视觉与模式识别
2026-05-11 v1
摘要
指涉音视频分割(Referring Audio-Visual Segmentation, Ref-AVS)旨在基于视觉、听觉和文本指涉线索,在视频帧中局部化和分割目标对象。该任务具有挑战性,因为不同指涉表达和场景下,不同模态的相关性会有所不同,而现有方法通常将多模态线索视为均匀的输入进行融合、提示或推理,使其对无关或误导性模态较为脆弱。为解决此问题,本文提出PRIMED,灵感来自认知神经科学中的偏好竞争理论,该方法显式建模视觉感知和语言驱动的先验调制,实现更精确的Ref-AVS。具体而言,首先引入Modality Prior Decoder,以估计指涉表达是主要依赖于音频、视觉还是其联合互动,生成模态先验以适应性地引导高层注意力。随后,Token Distiller进一步从高层特征中提取紧凑的全局视觉标记,并在 Competition-aware Cross-modal Fusion 模块之间共享,以提供层次化的全局上下文。此外,我们引入空间感知语义对齐损失,以通过对比学习进一步增强前景-背景判别。大量实验在Ref-AVS基准数据集上表明,PRIMED实现了最先进的总体性能。
引用
@article{arxiv.2605.07154,
title = {PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition},
author = {Yuchen He and Jing Zhang},
journal= {arXiv preprint arXiv:2605.07154},
year = {2026}
}
备注
11 pages, 8 figures