中文

合作至关重要:探索多阶双边关系用于视听分割

计算机视觉与模式识别 2024-04-09 v2 人工智能 声音 音频与语音处理

摘要

最近,一项视听分割(AVS)任务被提出,旨在将给定视频中发声物体的像素进行分组。该任务首次要求对场景进行音频驱动的像素级理解,这带来了巨大挑战。在本文中,我们提出了一个创新的视听Transformer框架,称为COMBO,即多阶双边关系合作的缩写。我们的框架首次探索了AVS中的三种双边纠缠:像素纠缠、模态纠缠和时间纠缠。关于像素纠缠,我们采用了一个孪生编码器模块(SEM),利用先验知识从基础模型中生成更精确的视觉特征。对于模态纠缠,我们设计了一个双边融合模块(BFM),使COMBO能够双向对齐相应的视觉和听觉信号。至于时间纠缠,我们根据时间的固有规律引入了一种创新的自适应帧间一致性损失。在AVSBench-object(S4上84.7 mIoU,MS3上59.2 mIoU)和AVSBench-semantic(AVSS上42.1 mIoU)数据集上的综合实验和消融研究表明,COMBO超越了以往最先进的方法。代码和更多结果将在https://yannqi.github.io/AVS-COMBO/上公开。

关键词

引用

@article{arxiv.2312.06462,
  title  = {Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation},
  author = {Qi Yang and Xing Nie and Tong Li and Pengfei Gao and Ying Guo and Cheng Zhen and Pengfei Yan and Shiming Xiang},
  journal= {arXiv preprint arXiv:2312.06462},
  year   = {2024}
}

备注

CVPR 2024 Highlight. 13 pages, 10 figures