基于多预训练任务的听觉与视觉表征学习
计算机视觉与模式识别
2022-01-05 v1 多媒体
摘要
不同的自监督任务(SSL)揭示数据中不同的特征。所学特征表示在各下游任务中可能表现出不同的性能。有鉴于此,本工作旨在结合多种SSL任务(Multi-SSL),使其对所有下游任务均具有良好泛化性。具体而言,本研究分别考察双耳声音与图像数据。对于双耳声音,我们提出三个SSL任务,即空间对齐、前景物体与双耳音频的时间同步以及时间间隙预测。我们研究了多种Multi-SSL方法,并深入分析了在OmniAudio数据集上视频检索、空间声音超分辨率与语义预测等下游任务的性能。我们在双耳声音表示上的实验表明,通过SSL任务的增量学习(IL)实现的Multi-SSL在下游任务性能上优于单一SSL任务模型与全监督模型。作为对其他模态适用性的检验,我们也构建了用于图像表示学习的Multi-SSL模型,并采用近期提出的SSL任务MoCov2与DenseCL。在此,Multi-SSL在VOC07分类上超越MoCov2、DenseCL和DetCo近期方法分别达2.06%、3.27%和1.19%,在COCO检测上AP分别高出+2.83、+1.56和+1.61。代码将公开可用。
引用
@article{arxiv.2201.01046,
title = {Sound and Visual Representation Learning with Multiple Pretraining Tasks},
author = {Arun Balajee Vasudevan and Dengxin Dai and Luc Van Gool},
journal= {arXiv preprint arXiv:2201.01046},
year = {2022}
}
备注
11 pages, 3 figures