中文

视频 JEPA 的分解潜在动力学:辅助目标的实证研究

计算机视觉与模式识别 2026-05-19 v1 机器学习

摘要

联合嵌入预测架构(JEPA)是自监督视频表征学习的有前景的框架,但小规模 Video-JEPA 训练中辅助目标的行为尚未得到充分 characterization。我们报告了对 18 种辅助目标变体进行的小规模实证研究,涵盖两种预训练方案:单数据集(UCF-101)和混合数据集(UCF-101 + Something-Something V2 + ImageNet-100)。我们在三个互补基准上评估冻结表征:Diving-48(细粒度运动)、Something-Something V2(时序推理)和 ImageNet-100(外观)。我们的实验表明,许多辅助目标 exhibit 容量权衡:在一个下游能力上的提升往往伴随另一个下游能力的下降。随后我们研究了 FWM-HW-LD(Factorized World-Model with Hard-Region-Weighted Latent Dynamics),这是一种训练时目标函数,将潜在表征分离为外观和动力学子空间,并对 JEPA 预测误差和潜在动力学误差施加硬区域加权。在我们的混合数据集设置下,FWM-HW-LD 在 ImageNet-100 上提升了 +5.92 个百分点,在 SSv2 上提升了 +3.21 个百分点,而在 Diving-48 上保持在 0.30 个百分点以内。这些结果表明,潜在分解是研究 Video-JEPA 中辅助目标权衡的有用方向。

关键词

引用

@article{arxiv.2605.17165,
  title  = {Factorized Latent Dynamics for Video JEPA: An Empirical Study of Auxiliary Objectives},
  author = {Santosh Premi},
  journal= {arXiv preprint arXiv:2605.17165},
  year   = {2026}
}