中文

面向单图像编码器的视频自蒸馏:迈向物理上合理的感知

计算机视觉与模式识别 2025-07-28 v1

摘要

自监督图像编码器(如DINO)近来因无需标签即可学习鲁棒视觉特征而备受关注。然而,大多数自监督学习方法在静态图像上训练,忽略了视频中固有的时间线索。我们引入了一种视频蒸馏的单图像编码器,该编码器被训练用于从当前帧预测下一帧的表示。这一简单目标在不使用光流或跟踪的情况下注入了3D空间和时间先验。当在单个2小时视频上进行预训练时,我们的方法将ADE20K上的平均交并比从35.0(DoRA)提升至36.4,同时仍可作为图像流水线的即插即用替代方案。我们的结果凸显了视频自蒸馏作为实现几何感知感知(这是物理上合理世界模型和物理人工智能的基本要素)的一种轻量级途径。

关键词

引用

@article{arxiv.2507.19272,
  title  = {Video Self-Distillation for Single-Image Encoders: A Step Toward Physically Plausible Perception},
  author = {Marcel Simon and Tae-Ho Kim and Seul-Ki Yeom},
  journal= {arXiv preprint arXiv:2507.19272},
  year   = {2025}
}

备注

4 pages, 2 figures, 2 tables