以声音提示分割:可泛化的音视觉源定位器
计算机视觉与模式识别
2024-02-05 v3 机器学习
多媒体
声音
音频与语音处理
摘要
从未同时见过某物体并听过其声音,模型是否仍能从输入音频中准确定位其视觉位置?在本工作中,我们聚焦于音视觉定位与分割任务,但处于更具挑战性的零样本与少样本场景。为实现该目标,不同于现有大多采用编码器-融合-解码器范式从融合音视觉特征中解码定位信息的方法,我们引入编码器-提示-解码器范式,旨在借助预训练模型的丰富知识更好地契合数据稀缺与数据分布多变的困境。具体而言,我们首先提出构建语义感知音频提示(SAP)以帮助视觉基础模型聚焦于发声物体,同时鼓励缩小视觉与音频模态间的语义鸿沟。随后,我们开发了相关性适配器(ColA)以在保持最小训练代价的同时维持视觉基础模型的充分知识。借助这些手段,大量实验表明这一新范式在未见类别与跨数据集设定下均优于其他基于融合的方法。我们希望本工作能进一步推进音视觉定位与分割在实际应用场景中的泛化研究。
引用
@article{arxiv.2309.07929,
title = {Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer},
author = {Yaoting Wang and Weisong Liu and Guangyao Li and Jian Ding and Di Hu and Xi Li},
journal= {arXiv preprint arXiv:2309.07929},
year = {2024}
}
备注
Accepted by AAAI 2024