跨模态认知共识引导的视听分割
图像与视频处理
2024-12-25 v5 声音
音频与语音处理
摘要
视听分割(AVS)旨在从视频帧中提取发声物体,以像素级分割掩码表示,应用于多模态视频编辑、增强现实和智能机器人系统等场景。开创性工作通过密集特征级视听交互来完成该任务,忽略了不同模态之间的维度鸿沟。更具体地,音频片段在每个序列中只能提供全局语义标签,而视频帧覆盖了不同局部区域中的多个语义物体,这导致对表征相似但语义不同的物体的错误定位。本文提出一种跨模态认知共识引导网络(C3N),从全局维度对齐视听语义,并通过注意力机制逐步将其注入局部区域。首先,设计跨模态认知共识推断模块(C3IM),通过整合音频/视觉分类置信度与模态无关标签嵌入的相似度,提取统一模态标签。随后,通过认知共识引导注意力模块(CCAM)将统一模态标签作为显式语义级引导反馈至视觉骨干网络,突出感兴趣物体对应的局部特征。在AVSBench数据集的单声源分割(S4)与多声源分割(MS3)设定上的大量实验证明了所提方法的有效性,其取得了最先进的性能。代码见 https://github.com/ZhaofengSHI/AVS-C3N。
引用
@article{arxiv.2310.06259,
title = {Cross-modal Cognitive Consensus guided Audio-Visual Segmentation},
author = {Zhaofeng Shi and Qingbo Wu and Fanman Meng and Linfeng Xu and Hongliang Li},
journal= {arXiv preprint arXiv:2310.06259},
year = {2024}
}
备注
Accepted by IEEE Transactions on Multimedia; 16 pages