面向细粒度音视频学习的区域感知声源理解
计算机视觉与模式识别
2026-03-11 v1
摘要
音视频学习 (AVL) 是多模态学习和具身智能的一个基本任务,显示出在场景理解和交互中发挥关键作用的作用。然而,前期研究者大多关注从粗粒度视角探索下游任务(例如音视频对应、声源定位和音视频事件定位)。考虑到提供更具体的场景感知细节,我们新定义了一个细粒度音视频学习任务,称为区域感知声源理解 (RA-SSU),旨在实现区域感知的、帧级的、高质量的声源理解。为支持这一目标,我们创新性地构建了两个相应数据集,即细粒度音乐 (f-Music) 和细粒度生活场景 (f-Lifescene) 数据集,每个数据集包含标注的声源掩码和逐帧文本描述。f-Music数据集包含3,976个样本,覆盖22种场景类型,聚焦具有复杂乐器混合的音乐场景。f-Lifescene数据集包含6,156个样本,覆盖61种类型,代表多样化的生活场景中作响对象。此外,我们提出了SSUFormer,即Sound-Source Understanding TransFormer基准模型,支持声源分割和声源区域描述的多模态输入和多模态输出架构。具体而言,我们设计了两个模块:掩码协作模块 (MCM) 和层次化提示专家混合模型 (MoHE),分别用于提高精度和丰富声源描述的详尽性。对我们两个数据集上的大量实验表明了该任务的可行性,评估了数据集的可用性,并展示了SSUFormer在声源理解基准测试中取得了SOTA性能。
引用
@article{arxiv.2603.09809,
title = {RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding},
author = {Muyi Sun and Yixuan Wang and Hong Wang and Chen Su and Man Zhang and Xingqun Qi and Qi Li and Zhenan Sun},
journal= {arXiv preprint arXiv:2603.09809},
year = {2026}
}
备注
Accepted by IEEE TMM