CDFSL-V:面向视频的跨域少样本学习
计算机视觉与模式识别
2023-09-18 v2
摘要
少样本视频动作识别是一种仅用少量标注样本识别新类别的有效方法,从而减少了收集和标注大规模视频数据集所带来的挑战。视频动作识别的现有方法依赖于来自同一领域的大量标注数据集。然而,这种设定并不现实,因为新类别可能来自具有不同空间和时间特征的不同的数据域。源域和目标域之间的这种差异性会带来显著挑战,使得传统的少样本动作识别技术失效。为解决此问题,在本工作中,我们提出了一种新颖的跨域少样本视频动作识别方法,利用自监督学习和课程学习来平衡来自源域和目标域的信息。具体而言,我们的方法采用基于掩码自编码器的自监督训练目标,以自监督方式从源数据和目标数据中学习。然后,一个渐进式课程平衡从源数据集学习的判别性信息与从目标域学习的通用信息。最初,我们的课程利用监督学习从源数据学习类别判别特征。随着训练推进,我们过渡到学习目标域特定特征。我们提出一种渐进式课程,以基于源域中类别判别的监督特征来促进目标域中丰富特征的出现。我们在多个具有挑战性的基准数据集上评估了我们的方法,并证明我们的方法优于现有的跨域少样本学习技术。我们的代码可在 https://github.com/Sarinda251/CDFSL-V 获取。
引用
@article{arxiv.2309.03989,
title = {CDFSL-V: Cross-Domain Few-Shot Learning for Videos},
author = {Sarinda Samarasinghe and Mamshad Nayeem Rizve and Navid Kardan and Mubarak Shah},
journal= {arXiv preprint arXiv:2309.03989},
year = {2023}
}
备注
ICCV 2023