中文

面向视频理解的联邦自监督学习

计算机视觉与模式识别 2022-07-21 v2

摘要

配备摄像头的移动设备的普及导致边缘端产生大量无标签视频数据。尽管已提出多种自监督学习(SSL)方法来挖掘其潜在的时空表征以用于特定任务训练,但包括隐私担忧与通信成本在内的实际挑战阻碍了 SSL 的大规模部署。为缓解这些问题,我们提出将联邦学习(FL)用于视频 SSL 任务。本工作中,我们评估了当前最先进(SOTA)视频 SSL 技术的性能,并识别出它们在由 kinetics-400 数据集模拟的大规模 FL 设定中集成时的缺陷。随后我们提出一种新颖的视频联邦 SSL 框架,称为 FedVSSL,其集成了不同聚合策略与部分权重更新。大量实验证明了 FedVSSL 的有效性与重要性:其在下游检索任务上以 6.66% 的优势超越集中式 SOTA(UCF-101)并以 5.13% 的优势超越(HMDB-51)。

关键词

引用

@article{arxiv.2207.01975,
  title  = {Federated Self-supervised Learning for Video Understanding},
  author = {Yasar Abbas Ur Rehman and Yan Gao and Jiajun Shen and Pedro Porto Buarque de Gusmao and Nicholas Lane},
  journal= {arXiv preprint arXiv:2207.01975},
  year   = {2022}
}