中文

通过高阶运动流进行共轭视觉表征的持续学习

计算机视觉与模式识别 2024-09-19 v1 机器学习

摘要

由于数据的非独立同分布特性,使用神经网络从连续的视频流中进行学习带来了若干挑战。然而,它也提供了发展与信息流一致的表示的新机会。在本文中,我们研究了在多种运动诱导约束下进行无监督持续学习像素级特征的情况,因此命名为运动共轭特征表示。与现有方法不同,运动不是给定的信号(无论是真值还是由外部模块估计),而是渐进式自主学习过程的结果,该过程发生在特征层次的各个级别。多个运动流通过神经网络进行估计,并以不同级别的抽象为特征,范围从传统的光流到源自更高层特征的其他潜在信号,因此称为高阶运动。持续学习开发一致的多阶流和表示容易导致平凡解,我们通过引入一种自监督对比损失来抵消这一点,该损失具有空间感知能力,并基于流诱导的相似性。我们在逼真的合成流和真实世界视频上评估了我们的模型,并与预训练的最先进特征提取器(也基于 Transformer)以及最近的无人监督学习模型进行了比较,我们的方法显著优于这些替代方案。

关键词

引用

@article{arxiv.2409.11441,
  title  = {Continual Learning of Conjugated Visual Representations through Higher-order Motion Flows},
  author = {Simone Marullo and Matteo Tiezzi and Marco Gori and Stefano Melacci},
  journal= {arXiv preprint arXiv:2409.11441},
  year   = {2024}
}

备注

Currently under review