从自我中心视频中的音视觉对应学习空间特征
计算机视觉与模式识别
2024-05-07 v4 声音
音频与语音处理
摘要
我们提出一种基于自我中心视频中空间音视觉对应的自监督表示学习方法。我们的方法使用掩码自编码框架,通过音频与视觉的协同来合成被掩码的双耳(多通道)音频,从而学习两种模态间有用的空间关系。我们利用预训练特征处理两项需要社交场景空间理解的下游视频任务:活跃说话人检测与空间音频降噪。通过大量实验,我们表明我们的特征具有足够通用性,可在两个提供双耳音频的挑战性自我中心视频数据集 EgoCom 和 EasyCom 上超越两项任务上的多个 SOTA 基线。项目:http://vision.cs.utexas.edu/projects/ego_av_corr。
引用
@article{arxiv.2307.04760,
title = {Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos},
author = {Sagnik Majumder and Ziad Al-Halah and Kristen Grauman},
journal= {arXiv preprint arXiv:2307.04760},
year = {2024}
}
备注
Accepted to CVPR 2024