AVESFormer:面向实时音视频分割的高效 Transformer 设计
计算机视觉与模式识别
2024-08-06 v1
摘要
最近,基于 Transformer 的模型在音视频分割(AVS)任务上展现出卓越的性能。然而,其高昂的计算成本使得实时推理难以实现。通过刻画网络注意力图,我们识别了 AVS 模型中的两个关键瓶颈:1)注意力耗散,即在受限帧内导致注意力权重过度集中;2)不高效、负担沉重的 Transformer 解码器,由于早期阶段的局限注意力模式所致。本文引入了 AVESFormer,即首个实现快速、高效和轻量化三者兼顾的实时音视频高效分割 Transformer。我们的模型利用高效提示查询生成器纠正交叉注意力的行为。此外,我们提出了 ELF 解码器,通过引入适用于局部特征的卷积来提升效率,减轻计算负担。大量实验表明,我们的 AVESFormer显著提升了模型性能,在 S4 上达到 79.9%,在 MS3 上达到 57.9%,在 AVSS 上达到 31.2%,超越了之前的 SOTA 水平,在性能与速度之间实现了优异的平衡。代码可在 https://github.com/MarkXCloud/AVESFormer.git 查看。
关键词
引用
@article{arxiv.2408.01708,
title = {AVESFormer: Efficient Transformer Design for Real-Time Audio-Visual Segmentation},
author = {Zili Wang and Qi Yang and Linsu Shi and Jiazhong Yu and Qinghua Liang and Fei Li and Shiming Xiang},
journal= {arXiv preprint arXiv:2408.01708},
year = {2024}
}