用于高效视觉声源分离的V-SlowFast网络
计算机视觉与模式识别
2021-09-22 v2 声音
音频与语音处理
摘要
本文的目标是进行视觉声源分离:i) 我们研究不同时间分辨率谱图上的视觉声源分离;ii) 我们提出一个新的轻量且高效的三流框架V-SlowFast,其作用于视觉帧、慢速谱图和快速谱图。慢速谱图捕捉粗时间分辨率,而快速谱图包含细粒度时间分辨率;iii) 我们引入两个对比目标,鼓励网络学习具有判别性的视觉特征以分离声音;iv) 我们提出一个音视觉全局注意力模块用于音频与视觉特征融合;v) 所引入的V-SlowFast模型在小规模和大规模数据集MUSIC-21、AVE和VGG-Sound上基于单帧的视觉声源分离中优于先前最先进水平。我们还提出了一个小型V-SlowFast架构变体,与先前的多阶段模型相比,其模型参数量减少74.2%,GMACs减少81.4%。项目页面:https://ly-zhu.github.io/V-SlowFast
引用
@article{arxiv.2109.08867,
title = {V-SlowFast Network for Efficient Visual Sound Separation},
author = {Lingyu Zhu and Esa Rahtu},
journal= {arXiv preprint arXiv:2109.08867},
year = {2021}
}
备注
total 21 pages: main paper 8 pages, references 3 pages, supplementary material 10 pages