MC-JEPA:一种用于运动与内容特征自监督学习的联合嵌入预测架构
计算机视觉与模式识别
2023-07-25 v1 人工智能
机器学习
摘要
视觉表征的自监督学习一直聚焦于学习内容特征,这类特征不捕捉物体运动或位置,而侧重于识别和区分图像与视频中的物体。另一方面,光流估计是一项不涉及理解其所估计图像内容的任务。我们统一了这两种方法并引入 MC-JEPA,一种联合嵌入预测架构与自监督学习方法,在共享编码器中联合学习光流与内容特征,表明两个相关目标——光流估计目标与自监督学习目标——相互受益,从而学习到融合运动信息的内容特征。所提方法在无监督光流基准以及图像与视频语义分割等下游任务的常见自监督学习方法上均取得相当的性能。
引用
@article{arxiv.2307.12698,
title = {MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features},
author = {Adrien Bardes and Jean Ponce and Yann LeCun},
journal= {arXiv preprint arXiv:2307.12698},
year = {2023}
}