中文

EgoM2P:面向以太为中心的多模态多任务预训练

计算机视觉与模式识别 2025-07-22 v3

摘要

理解以太为中心的视觉多模态信号(如 RGB 视频、深度、相机姿态和凝视),对于增强现实、机器人和人机交互等应用至关重要,使系统能够更好地解释摄像器佩戴者的动作、意图和周围环境。然而,构建大规模以太为中心的多模态和多任务模型 presents 独特挑战。以太数据本质上是异构的,设备和环境之间的模态覆盖范围存在较大差异。对于缺失模态(如凝视或头戴式相机轨迹)的伪标签生成往往不可行,这使得标准的监督学习方法难以规模化。此外,动态相机运动以及第一人称视频的复杂时空结构为直接应用现有的多模态基础模型带来了额外挑战。为此,我们引入了一套高效的时序标记器,提出 EgoM2P,一种基于掩码建模的框架,从时序感知的多模态标记中学习,以训练一个大型通用模型用于以太 4D 理解。这种统一的设计支持跨多样化以太感知和合成任务的多任务学习,包括凝视预测、以太相机跟踪和从以太视频中进行的单目深度估计,同时也可作为条件以太视频合成的生成模型。跨越这些任务,EgoM2P 在准确度和速度上均与或优于专门模型,速度快一个数量级。我们将完全开源 EgoM2P 以支持社区并推动以太视觉研究。项目页面:https://egom2p.github.io/。

关键词

引用

@article{arxiv.2506.07886,
  title  = {EgoM2P: Egocentric Multimodal Multitask Pretraining},
  author = {Gen Li and Yutong Chen and Yiqian Wu and Kaifeng Zhao and Marc Pollefeys and Siyu Tang},
  journal= {arXiv preprint arXiv:2506.07886},
  year   = {2025}
}

备注

Accepted by ICCV 2025