CatNet:面向终身自我中心手势识别的类增量三维卷积网络
计算机视觉与模式识别
2020-04-21 v1 机器学习
图像与视频处理
摘要
自我中心手势是人类与 VR/AR 头盔和眼镜等可穿戴设备交互的最自然沟通形式。此类真实应用场景中的一个主要问题是,可能很容易变得有必要向系统中添加新手势,例如,一个合适的 VR 系统应允许用户增量式自定义手势。传统深度学习方法需要在系统中存储所有先前类别样本,并通过融合先前样本与新样本从头重新训练模型,这耗费巨大内存并随时间显著增加计算量。在本工作中,我们展示了一个终身三维卷积框架——类(c)增(a)量(t)网(Net)络(CatNet),其考虑视频中的时间信息,并通过学习从先前类别样本中选取的范例集的特征表示,实现自我中心手势视频识别的终身学习。重要的是,我们提出了一种双流 CatNet,其部署 RGB 与深度模态来训练两个独立网络。我们在公开可用数据集——EgoGesture 数据集上评估 CatNet,并表明 CatNets 能在长时间内增量学习许多类别。结果还表明,与其他 3 种单流架构相比,双流架构在联合训练与类增量训练上均取得最佳性能。本工作中使用的代码与预训练模型发布于 https://github.com/villawang/CatNet。
引用
@article{arxiv.2004.09215,
title = {CatNet: Class Incremental 3D ConvNets for Lifelong Egocentric Gesture Recognition},
author = {Zhengwei Wang and Qi She and Tejo Chalasani and Aljosa Smolic},
journal= {arXiv preprint arXiv:2004.09215},
year = {2020}
}
备注
CVPR 2020 Workshop at Continual Learning (CLVISION)