Exo2Ego: 外中心知识引导的 MLLM 用于自我中心视频理解
计算机视觉与模式识别
2025-12-17 v2
摘要
通过机器人或可穿戴设备部署的 AI 个人助手,需要具备具身理解能力才能与人类有效协作。然而,当前的多模态大语言模型(MLLMs)主要关注第三人称(外中心)视觉,忽略了第一人称(自我中心)视频的独特挑战。此外,高昂的获取成本限制了数据规模,损害了 MLLM 的性能。为了应对这些挑战,我们提出学习外中心与自我中心领域之间的映射,利用现有 MLLM 中丰富的外中心知识来增强自我中心视频理解。为此,我们引入了 Ego-ExoClip,一个包含 110 万对源自 Ego-Exo4D 的同步自我-外中心片段-文本对的预训练数据集,以及从多个来源收集以增强模型指令遵循能力的指令微调数据集 EgoIT。基于这些数据集,我们提出了一种迁移策略,并进一步设计了一个包含三个阶段的渐进式映射学习流水线:演示者自我准备、演示者-学习者引导和学习者自我练习。在多种自我中心任务上的广泛实验表明,现有 MLLM 在自我中心视频理解中表现不佳,而我们的模型显著优于这些领先模型。
引用
@article{arxiv.2503.09143,
title = {Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding},
author = {Haoyu Zhang and Qiaohui Chu and Meng Liu and Haoxiang Shi and Yaowei Wang and Liqiang Nie},
journal= {arXiv preprint arXiv:2503.09143},
year = {2025}
}
备注
This paper is accepted by AAAI 2026