中文

沿音视事件线的对比正样本传播

计算机视觉与模式识别 2022-11-21 v1

摘要

视觉与音频信号在自然环境中常共存,形成音视事件(AVEs)。给定一段视频,我们旨在定位包含 AVE 的视频片段并识别其类别。学习各视频片段的判别性特征至关重要。与现有聚焦于音视特征融合的工作不同,本文提出一种新的对比正样本传播(CPSP)方法,以更好地进行深度特征表示学习。CPSP 的贡献在于引入可用的全监督或弱监督标签作为先验,为对比学习构建精确的正-负样本。具体而言,CPSP 包含全面的对比约束:成对级正样本传播(PSP)、片段级与视频级正样本激活(PSAS_S 与 PSAV_V)。提出了三个新的对比目标(即 Lavpsp\mathcal{L}_{\text{avpsp}}Lspsa\mathcal{L}_\text{spsa}Lvpsa\mathcal{L}_\text{vpsa})并引入到全监督与弱监督 AVE 定位中。为描绘 AVE 定位中对比学习的完整图景,我们还研究了自监督正样本传播(SSPSP)。因此,CPSP 更有助于获得区别于负样本的精炼音视特征,从而有益于分类器预测。在 AVE 与新收集的 VGGSound-AVEL100k 数据集上的大量实验验证了方法的有效性与泛化能力。

关键词

引用

@article{arxiv.2211.09980,
  title  = {Contrastive Positive Sample Propagation along the Audio-Visual Event Line},
  author = {Jinxing Zhou and Dan Guo and Meng Wang},
  journal= {arXiv preprint arXiv:2211.09980},
  year   = {2022}
}

备注

Accepted to TPAMI; Dataset and Code are available at https://github.com/jasongief/CPSP. arXiv admin note: substantial text overlap with arXiv:2104.00239