中文

CATR:用于音视频视频分割的组合依赖音频查询Transformer

计算机视觉与模式识别 2023-09-21 v2

摘要

音视频视频分割(AVVS)旨在生成图像帧中发声物体的像素级映射,并确保映射忠实遵循给定音频,例如识别并分割视频中唱歌的人。然而,现有方法存在两个局限:1)它们分别处理视频时间特征与音视频交互特征,忽视了音频与视频组合所固有的时空依赖;2)它们在解码阶段不充分引入音频约束与物体级信息,导致分割结果无法遵从音频指令。为解决这些问题,我们提出一种解耦的音视频 Transformer,其从各自的时间与空间维度组合音频与视频特征,捕捉它们的组合依赖。为优化内存消耗,我们设计了一个模块,该模块在堆叠时能够以内存高效的方式捕捉音视频细粒度组合依赖。此外,我们在解码阶段引入音频约束查询。这些查询包含丰富的物体级信息,确保解码出的掩码遵循声音。实验结果证实了我们的方法的有效性,我们的框架在使用两种骨干网络的所有三个数据集上均取得了新的 SOTA 性能。代码见 \url{https://github.com/aspirinone/CATR.github.io}

关键词

引用

@article{arxiv.2309.09709,
  title  = {CATR: Combinatorial-Dependence Audio-Queried Transformer for Audio-Visual Video Segmentation},
  author = {Kexin Li and Zongxin Yang and Lei Chen and Yi Yang and Jun Xiao},
  journal= {arXiv preprint arXiv:2309.09709},
  year   = {2023}
}

备注

accepted by ACM MM 2023