音视频分割中时间错位的协同混合传播器
计算机视觉与模式识别
2024-12-12 v1 机器学习
多媒体
声音
音频与语音处理
摘要
音视频视频分割(AVVS)旨在生成与相应音频精确对齐的声源物体像素级地图。然而,现有方法常常面临时间错位问题,即音频线索与分割结果在时间上不协调。音频提供两条关键信息:i) 目标物体级别的细节和 ii) 物体开始和停止发声的时刻。当前方法更关注物体级别信息,但忽略了音频语义变化的边界,导致时间错位。为解决这一问题,我们提出了协同混合传播框架(Co-Prop)。该框架包括两个主要步骤:初步音频边界锚定和逐帧音频插入传播。为了锚定音频边界,我们采用检索辅助提示与 Qwen 大语言模型来识别音频语义变化的控制点。这些控制点将音频划分为语义一致的音频片段。在获得控制点列表后,我们提出了音频插入传播器,使用逐帧音频插入传播与匹配方法处理每个音频片段。我们整理了一个包含多样化源转换案例的紧凑数据集,并设计了一种评估对齐率的指标。与传统的同步处理方法相比,我们的方法降低了内存需求并促进了帧对齐。实验结果证明了该方法在三个数据集和两个骨干网络上的有效性。此外,我们的方法可以与现有的 AVVS 方法集成,提供即插即用功能以提升其性能。
引用
@article{arxiv.2412.08161,
title = {Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation},
author = {Kexin Li and Zongxin Yang and Yi Yang and Jun Xiao},
journal= {arXiv preprint arXiv:2412.08161},
year = {2024}
}