中文

学习要听什么:提升面向音频-视觉实例分割的声源关联能力

音频与语音处理 2026-01-30 v2 人工智能 多媒体 声音

摘要

音频-视觉实例分割(AVIS)需要准确局部化和跟踪视频序列中作响对象。现有方法因两个根本问题导致视觉偏见:统一的加性融合阻止查询针对不同声源进行专业化,而仅基于视觉的训练目标允许查询收敛到任意显著对象。我们提出基于交叉注意力的 Audio-Centric Query Generation,使每个查询能够选择性地注意于不同的声源,并将声源特定的先验引入视觉解码。此外,我们引入 Sound-Aware Ordinal Counting(SAOC)损失,通过序数回归和单调一致性约束显式监督作响对象数量,防止视觉-only 收敛。实验在 AVISeg 基准上表现出一致性改进:+1.64 mAP、+0.6 HOTA 和 +2.06 FSLA,验证了查询专业化和显式计数监督对于准确的音频-视觉实例分割至关重要。

关键词

引用

@article{arxiv.2509.22740,
  title  = {Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation},
  author = {Jinbae Seo and Hyeongjun Kwon and Kwonyoung Kim and Jiyoung Lee and Kwanghoon Sohn},
  journal= {arXiv preprint arXiv:2509.22740},
  year   = {2026}
}

备注

Accepted to ICASSP 2026