看见语音与声音:视觉场景中音频的辨识与定位
计算机视觉与模式识别
2025-03-25 v1 声音
音频与语音处理
摘要
我们提出一种统一模型,能够同时在视觉场景中对 spoken language 和 non-speech sounds 进行 grounding,从而解决当前音频-视觉 grounding 模型的关键局限性。现有方法通常仅能独立或按序处理 speech 或 non-speech sounds,甚至能一起但需顺序,无法捕捉现实场景中混合音频源的复杂性。我们的方法引入“混合-分离”框架,通过音频-视觉对齐目标实现联合学习 correspondence 与 disentanglement,使用混合音频。通过这些目标,模型学习为每种音频类型生成 distinct embeddings,实现对混合音频源的有效 disentanglement 与 grounding。此外,我们创建了一个用于评估混合音频源同时 grounding 的新数据集,证明我们的模型超越了先前方法。我们的方法在标准分割和跨模态检索任务中也实现了相当或更好的性能,凸显了 mix-and-separate 方法的优势。
引用
@article{arxiv.2503.18880,
title = {Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes},
author = {Hyeonggon Ryu and Seongyu Kim and Joon Son Chung and Arda Senocak},
journal= {arXiv preprint arXiv:2503.18880},
year = {2025}
}
备注
CVPR 2025