DDAVS:用于音频-视觉分割的解缥散音频语义与延迟双向对齐
计算机视觉与模式识别
2025-12-24 v1 声音
音频与语音处理
摘要
音频-视觉分割旨在通过联合利用听觉和视觉信息在像素级别定位产生声音的物体.然而,现有方法常受到多源缥散和音频-视觉错位问题,导致对较大或较响的物体产生偏见,而忽略较弱、较小或同时出现的来源.为此,本文提出了DDAVS,即解缥散音频语义与延迟双向对齐框架.为缓解多源缥散,DDAVS采用可学习的查询从音频中提取语义并锚定于源自音频原型存储库中结构化语义空间.通过对比学习进一步优化,以增强判别性和鲁棒性.为缓解音频-视觉错位,DDAVS引入双向注意力并延迟模态交互,提高了多模态对齐的鲁棒性.在AVS-Objects和VPO基准上进行了广泛实验,表明DDAVS在单源、多源和多实例情景中均优于现有方法,这些结果验证了该框架在面临挑战的真实世界音频-视觉分割条件下的有效性和可扩展性.项目页面:https://trilarflagz.github.io/DDAVS-page/
引用
@article{arxiv.2512.20117,
title = {DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation},
author = {Jingqi Tian and Yiheng Du and Haoji Zhang and Yuji Wang and Isaac Ning Lee and Xulong Bai and Tianrui Zhu and Jingxuan Niu and Yansong Tang},
journal= {arXiv preprint arXiv:2512.20117},
year = {2025}
}
备注
https://trilarflagz.github.io/DDAVS-page/