独一无二的生命,共享世界:基于单生命视频的学习范式
计算机视觉与模式识别
2026-05-27 v2
摘要
我们提出了“单生命”学习范式,其中仅在由单一个体捕获的体agnostic 视频上训练独立的视觉模型。我们利用单一生命中自然捕获的多种视角,以自监督方式学习视觉编码器。我们的实验发现三个关键发现。首先,针对不同生命独立训练的模型会发展出高度对齐的几何理解。我们通过在分别捕获不同生命(包括室内和室外)的独立数据集上训练视觉编码器,并引入一种新颖的跨注意力度量来量化不同模型内部表征的功能对齐程度。其次,我们表明单生命模型学习的是可泛化的几何表征,能够有效迁移到下游任务,如不可见环境中的深度估计。最后,我们展示了针对同一人一周(约30小时)的训练,性能可与训练30小时多样化网络数据相当,凸显了单生命表征学习的优势。总体而言,我们的结果表明,世界的共享结构既导致了在单个生命上训练的模型之间的一致性,又为视觉表征学习提供了强大的信号。
引用
@article{arxiv.2512.04085,
title = {Unique Lives, Shared World: Learning from Single-Life Videos},
author = {Tengda Han and Sayna Ebrahimi and Dilara Gokay and Li Yang Ku and Maks Ovsjanikov and Iva Babukova and Daniel Zoran and Viorica Patraucean and Joao Carreira and Andrew Zisserman and Dima Damen},
journal= {arXiv preprint arXiv:2512.04085},
year = {2026}
}