中文

渐进式置信掩码注意力网络用于音频视觉分割

计算机视觉与模式识别 2025-02-11 v2 人工智能 机器学习 多媒体

摘要

音频和视觉信号通常同时出现,人类具有关联和同步这两种模态信息的先天能力。最近,出现了一个具有挑战性的问题——音频视觉分割(AVS),旨在生成场景中发声物体的分割图。然而,目前提出的方法尚未充分整合音频和视觉信息,且计算成本极高。此外,不同阶段的输出也未得到充分利用。为促进该研究,我们提出了一种新颖的渐进式置信掩码注意力网络(PMCANet)。它利用注意力机制揭示音频信号与视觉帧之间的内在相关性。此外,我们设计了一个高效且有效的交叉注意力模块,通过选择查询令牌来增强语义感知。该选择基于网络多阶段预测输出的置信度驱动单元来确定。实验表明,我们的网络在需要更少计算资源的同时,优于其他AVS方法。代码地址:https://github.com/PrettyPlate/PCMANet。

关键词

引用

@article{arxiv.2406.02345,
  title  = {Progressive Confident Masking Attention Network for Audio-Visual Segmentation},
  author = {Yuxuan Wang and Jinchao Zhu and Feng Dong and Shuyue Zhu},
  journal= {arXiv preprint arXiv:2406.02345},
  year   = {2025}
}

备注

23 pages, 11 figures, submitted to Elsevier Knowledge-Based System