TransAVS:基于 Transformer 的端到端音视频分割
声音
2023-12-27 v2 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
音视频分割(AVS)是一项具有挑战性的任务,旨在通过探索音频信号分割视频帧中的发声物体。通常 AVS 面临两个关键挑战:(1)音频信号固有地表现出高度的信息密集性,因为多个物体产生的声音纠缠在同一音频流中;(2)同类物体往往产生相似的音频信号,难以区分从而导致不清晰的分割结果。为此,我们提出 TransAVS,首个基于 Transformer 的端到端 AVS 框架。具体而言,TransAVS 将音频流解耦为音频查询,其与图像交互并借助全 Transformer 架构解码为分割掩码。该方案不仅促进了全面的音频-图像交流,还显式挖掘了场景中封装的实例线索。同时,为促使这些音频查询捕获 distinctive 的发声物体而非退化为同质,我们在查询与掩码两个层面设计了两种自监督损失函数,使模型能在相似音频数据中捕获 distinctive 特征并实现更精确分割。我们的实验表明 TransAVS 在 AVSBench 数据集上取得了最先进(SOTA)结果,凸显了其在弥合音频与视觉模态鸿沟上的有效性。
引用
@article{arxiv.2305.07223,
title = {Transavs: End-To-End Audio-Visual Segmentation With Transformer},
author = {Yuhang Ling and Yuxi Li and Zhenye Gan and Jiangning Zhang and Mingmin Chi and Yabiao Wang},
journal= {arXiv preprint arXiv:2305.07223},
year = {2023}
}
备注
4 pages, 3 figures