自举你的视图:用于细粒度视图不变视频表示的掩码自我-外部建模
计算机视觉与模式识别
2025-04-01 v2 人工智能
摘要
从自我中心 (第一人称,ego) 和外部中心 (第三人称,exo) 视频中学习视图不变表示,是跨多个视角泛化视频理解系统的一种有前景的方法。然而,由于 ego 和 exo 视图在视角、运动模式和背景上存在显著差异,该领域一直未被充分探索。在本文中,我们提出了一种新颖的掩码 ego-exo 建模方法,称为 Bootstrap Your Own Views (BYOV),用于从非配对的 ego-exo 视频中学习细粒度视图不变视频表示,该方法同时促进因果时间动态和跨视图对齐。我们强调捕获人类动作的组合性质作为稳健跨视图理解基础的重要性。具体而言,自视图掩码和跨视图掩码预测被设计为同时学习视图不变且强大的表示。实验结果表明,我们的 BYOV 在四个下游 ego-exo 视频任务的所有指标上均显著超越现有方法并取得显著增益。代码可在 https://github.com/park-jungin/byov 获取。
关键词
引用
@article{arxiv.2503.19706,
title = {Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations},
author = {Jungin Park and Jiyoung Lee and Kwanghoon Sohn},
journal= {arXiv preprint arXiv:2503.19706},
year = {2025}
}
备注
CVPR 2025 Camera-ready, 18 pages, 7 figures, 9 tables