VINO: 通过结构先验引导的去情境化实现非情境物体的视频驱动不变性
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
自监督学习取得了快速进展,但学习到的特征往往过度依赖情境捷径——背景纹理和共现统计。虽然视频提供了丰富的时间变化,但密集的野外流伴随着强烈的自运动,造成了一个共现陷阱:前景物体和背景上下文一致地移动,鼓励表示坍缩为场景编码器。为了解决这个问题,我们提出了 VINO(Video-driven Invariance for Non-Contextual Objects),一个教师-学生框架,通过施加结构信息瓶颈从密集视频中学习鲁棒的图像编码器。使用一个与类别无关的结构先验仅用于生成视图——而非作为语义伪标签——VINO 形成了一个非对称蒸馏问题。教师从抑制了背景的前景联合视图中进行预测,而学生则观察保留周围上下文但移除竞争实例的物体条件场景视图。通过掩码蒸馏匹配这些目标使得背景线索变得不可靠,从而推动表示朝向以物体为中心的不变性。我们进一步通过基于跟踪匹配物体的教师锚定跨时间蒸馏来强制执行时间物体恒常性,并使用掩码引导的局部视图稳定部分到整体的连贯性。通过在 PASCAL VOC 上的注意力可视化和无监督物体发现,我们证明了 VINO 有效地将前景与背景分离。在密集的 Walking Tours Venice 视频上预训练后,VINO 达到了 34.8 的 CorLoc,产生了高度聚焦、偏向形状的表示,显著优于先前的密集视频和运动引导的自监督学习基线。
引用
@article{arxiv.2603.07222,
title = {VINO: Video-driven Invariance for Non-contextual Objects via Structural Prior Guided De-contextualization},
author = {Seul-Ki Yeom and Marcel Simon and Eunbin Lee and Tae-Ho Kim},
journal= {arXiv preprint arXiv:2603.07222},
year = {2026}
}
备注
18 pages, 2 Tables, 3 Figures