声源定位归根结底在于跨模态对齐
计算机视觉与模式识别
2023-09-20 v1 人工智能
多媒体
声音
音频与语音处理
摘要
人类可以轻松感知视觉场景中声源的方向,称为声源定位。近期基于学习的声源定位研究主要从定位角度探索该问题。然而,先前的工作和现有基准未考虑该问题一个更重要的方面,即跨模态语义理解,而这对于真正的声源定位至关重要。跨模态语义理解在理解语义不匹配的视听事件(例如静音物体或画外音)时十分重要。为此,我们提出将跨模态对齐任务作为声源定位的联合任务,以更好地学习音频与视觉模态之间的交互。从而,我们在强跨模态语义理解下实现了高定位性能。我们的方法在声源定位和跨模态检索方面均优于最先进的方法。我们的工作表明,联合解决这两个任务对于攻克真正的声源定位是必要的。
引用
@article{arxiv.2309.10724,
title = {Sound Source Localization is All about Cross-Modal Alignment},
author = {Arda Senocak and Hyeonggon Ryu and Junsik Kim and Tae-Hyun Oh and Hanspeter Pfister and Joon Son Chung},
journal= {arXiv preprint arXiv:2309.10724},
year = {2023}
}
备注
ICCV 2023