中文

截断-分割-对比:一种从误标注视频中学习的框架

计算机视觉与模式识别 2023-01-02 v2 机器学习

摘要

带噪标签学习(LNL)是一个经典问题,在图像任务中已被广泛研究,但在视频领域文献中研究甚少。若不考量视频的特性(如计算成本和冗余信息)而直接将图像方法迁移到视频,并非明智之选。本文针对带噪标签的视频分析提出两种新策略:1)一种轻量级通道选择方法,称为通道截断(Channel Truncation),用于基于特征的标签噪声检测,该方法选取最具判别力的通道以在每个类别中分割干净与含噪样本;2)一种新颖的对比策略,称为噪声对比学习(Noise Contrastive Learning),其构建干净与含噪样本间的关系以正则化模型训练。在三个知名视频分类基准数据集上的实验表明,我们提出的 truNcatE-split-contrAsT(NEAT)显著优于现有基线。通过将维度降至其 10%,我们的方法在严重噪声(对称-80%)下的 Mini-Kinetics 数据集上实现了超过 0.4 的噪声检测 F1 分数和 5% 的分类准确率提升。得益于噪声对比学习,在 Mini-Kinetics 和 Sth-Sth-V1 上的平均分类准确率提升超过 1.6%。

关键词

引用

@article{arxiv.2212.13495,
  title  = {Truncate-Split-Contrast: A Framework for Learning from Mislabeled Videos},
  author = {Zixiao Wang and Junwu Weng and Chun Yuan and Jue Wang},
  journal= {arXiv preprint arXiv:2212.13495},
  year   = {2023}
}

备注

Accepted by AAAI 2023