截断-分割-对比:一种从误标注视频中学习的框架
计算机视觉与模式识别
2023-01-02 v2 机器学习
摘要
带噪标签学习(LNL)是一个经典问题,在图像任务中已被广泛研究,但在视频领域文献中研究甚少。若不考量视频的特性(如计算成本和冗余信息)而直接将图像方法迁移到视频,并非明智之选。本文针对带噪标签的视频分析提出两种新策略:1)一种轻量级通道选择方法,称为通道截断(Channel Truncation),用于基于特征的标签噪声检测,该方法选取最具判别力的通道以在每个类别中分割干净与含噪样本;2)一种新颖的对比策略,称为噪声对比学习(Noise Contrastive Learning),其构建干净与含噪样本间的关系以正则化模型训练。在三个知名视频分类基准数据集上的实验表明,我们提出的 truNcatE-split-contrAsT(NEAT)显著优于现有基线。通过将维度降至其 10%,我们的方法在严重噪声(对称-80%)下的 Mini-Kinetics 数据集上实现了超过 0.4 的噪声检测 F1 分数和 5% 的分类准确率提升。得益于噪声对比学习,在 Mini-Kinetics 和 Sth-Sth-V1 上的平均分类准确率提升超过 1.6%。
引用
@article{arxiv.2212.13495,
title = {Truncate-Split-Contrast: A Framework for Learning from Mislabeled Videos},
author = {Zixiao Wang and Junwu Weng and Chun Yuan and Jue Wang},
journal= {arXiv preprint arXiv:2212.13495},
year = {2023}
}
备注
Accepted by AAAI 2023