分离“啁啾”与“聊天”:声音和语言的自监督视觉定位
计算机视觉与模式识别
2024-06-11 v1 计算与语言
信息检索
机器学习
声音
音频与语音处理
摘要
我们提出了DenseAV,一种新颖的双编码器定位架构,它仅通过观看视频就能学习高分辨率、语义有意义且音视频对齐的特征。我们展示了DenseAV能够发现词语的“含义”和声音的“位置”,而无需显式的定位监督。此外,它能在无监督的情况下自动发现并区分这两类关联。我们表明,DenseAV的定位能力源于一种新的多头特征聚合算子,该算子直接比较密集的图像和音频表示以进行对比学习。相比之下,许多其他学习“全局”音频和视频表示的系统无法定位词语和声音。最后,我们贡献了两个新数据集,以通过语音和声音提示的语义分割来改进音视频表示的评价。在这些数据集和其他数据集上,我们展示了DenseAV在语音和声音提示的语义分割任务上显著优于现有技术。DenseAV在跨模态检索上以不到一半的参数超越了之前的最先进技术ImageBind。项目页面:https://aka.ms/denseav
引用
@article{arxiv.2406.05629,
title = {Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language},
author = {Mark Hamilton and Andrew Zisserman and John R. Hershey and William T. Freeman},
journal= {arXiv preprint arXiv:2406.05629},
year = {2024}
}
备注
Computer Vision and Pattern Recognition 2024