沿音视事件线的对比正样本传播
计算机视觉与模式识别
2022-11-21 v1
摘要
视觉与音频信号在自然环境中常共存,形成音视事件(AVEs)。给定一段视频,我们旨在定位包含 AVE 的视频片段并识别其类别。学习各视频片段的判别性特征至关重要。与现有聚焦于音视特征融合的工作不同,本文提出一种新的对比正样本传播(CPSP)方法,以更好地进行深度特征表示学习。CPSP 的贡献在于引入可用的全监督或弱监督标签作为先验,为对比学习构建精确的正-负样本。具体而言,CPSP 包含全面的对比约束:成对级正样本传播(PSP)、片段级与视频级正样本激活(PSA 与 PSA)。提出了三个新的对比目标(即 、 与 )并引入到全监督与弱监督 AVE 定位中。为描绘 AVE 定位中对比学习的完整图景,我们还研究了自监督正样本传播(SSPSP)。因此,CPSP 更有助于获得区别于负样本的精炼音视特征,从而有益于分类器预测。在 AVE 与新收集的 VGGSound-AVEL100k 数据集上的大量实验验证了方法的有效性与泛化能力。
引用
@article{arxiv.2211.09980,
title = {Contrastive Positive Sample Propagation along the Audio-Visual Event Line},
author = {Jinxing Zhou and Dan Guo and Meng Wang},
journal= {arXiv preprint arXiv:2211.09980},
year = {2022}
}
备注
Accepted to TPAMI; Dataset and Code are available at https://github.com/jasongief/CPSP. arXiv admin note: substantial text overlap with arXiv:2104.00239