中文

用于鲁棒视听分割的频域分解与重组

计算机视觉与模式识别 2025-09-24 v1

摘要

视听分割(AVS)通过有效整合音频和视觉线索以精确分割视觉场景中的对象或区域,在多模态机器学习中扮演着关键角色。近期的AVS方法取得了显著进展。然而,它们忽略了音频与视觉模态之间固有的频域矛盾——音频高频信号中普遍存在的干扰噪声与视觉高频信号中结构丰富的细节。忽视这些差异可能导致次优性能。在本文中,我们从更深层的视角重新思考AVS任务,将其重新表述为频域分解与重组问题。为此,我们引入了一个新颖的频域感知视听分割(FAVS)框架,包含两个关键模块:频域增强分解器(FDED)模块和协同跨模态一致性(SCMC)模块。FDED模块采用基于残差的迭代频域分解来区分模态特定的语义和结构特征,SCMC模块利用混合专家架构通过动态专家路由来增强语义一致性和模态特定特征保留。大量实验表明,我们的FAVS框架在三个基准数据集上取得了SOTA性能,丰富的定性可视化进一步验证了所提出的FDED和SCMC模块的有效性。论文被接受后,代码将作为开源发布。

关键词

引用

@article{arxiv.2509.18912,
  title  = {Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation},
  author = {Yunzhe Shen and Kai Peng and Leiye Liu and Wei Ji and Jingjing Li and Miao Zhang and Yongri Piao and Huchuan Lu},
  journal= {arXiv preprint arXiv:2509.18912},
  year   = {2025}
}