中文

面向非约束自我中心视频中稳定自监督对象表征

计算机视觉与模式识别 2026-03-17 v1

摘要

人类通过感知和与环境的交互来发展视觉智能——这是一种植根于自我中心体验的自监督学习过程。受此启发,我们提出问题:人工系统如何在不依赖人工标注的情况下,从连续的、无整理的、第一人称视频中学习稳定的对象表征。这一设定面临在杂乱、遮挡和自我运动背景下分离、识别和持续追踪对象的挑战。我们提出 EgoViT,一个统一的视觉 Transformer 框架,旨在从无标注的自我中心视频中学习稳定的对象表征。EgoViT 通过三种协同机制引导这一学习过程来启动:(1) 原对象学习,利用帧内蒸馏形成判别性表征;(2) 深度正则化,将这些表征锚定在几何结构中;(3) 教师过滤的时间一致性,在时间上强制保持同一性。这创造了一个良性循环,其中初始对象假设被逐步细化为稳定、持久的表征。该框架在无标注的第一人称视频上端到端训练,对来自不同来源和质量的几何先验表现出鲁棒性。在标准基准测试上,EgoViT 在无监督对象发现上实现了 +8.0% 的 CorLoc 提升,在语义分割上实现了 +4.8% 的 mIoU 提升,展示了其为具身智能中的鲁棒视觉抽象奠定基础的潜力。

关键词

引用

@article{arxiv.2603.13912,
  title  = {Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video},
  author = {Yuting Tan and Xilong Cheng and Yunxiao Qin and Zhengnan Li and Jingjing Zhang},
  journal= {arXiv preprint arXiv:2603.13912},
  year   = {2026}
}

备注

24 pages, 11 figures. Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026