中文

EgoDTM:面向3D感知的以环视视频语言为导向的预训练

计算机视觉与模式识别 2025-12-05 v2 人工智能

摘要

环视视频语言预训练已显著推动了视频表征学习。人类感知并与一个完全三维的世界进行交互,发展出超越文本基础理解的空间意识。然而,大多数先前的工作仅从1维文本或2维视觉线索(如边界框)进行学习,这些线索本质上缺乏三维理解。为弥合这一差距,我们引入EgoDTM,即Egocentric Depth- and Text-aware Model,通过大规模3D感知视频预训练和视频文本对比学习进行联合训练。EgoDTM集成了轻量级3D感知解码器,高效地从深度估计模型生成的伪深度图中学习3D感知。为进一步促进3D感知视频预训练,我们通过有机组合多个基础模型,将手部-物体视觉线索添加到原始简短标题中。广泛的实验表明,EgoDTM在多样化的下游任务上表现出色,凸显了其在三维视觉理解方面的优越性能。代码:https://github.com/xuboshen/EgoDTM。

关键词

引用

@article{arxiv.2503.15470,
  title  = {EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining},
  author = {Boshen Xu and Yuting Mei and Xinbi Liu and Sipeng Zheng and Qin Jin},
  journal= {arXiv preprint arXiv:2503.15470},
  year   = {2025}
}

备注

Code: https://github.com/xuboshen/EgoDTM