中文

EgoLM: 自我中心运动的多模态语言模型

计算机视觉与模式识别 2024-09-27 v1

摘要

随着可穿戴设备的普及,学习自我中心运动对于发展情境化AI变得至关重要。在这项工作中,我们提出了EgoLM,一个通用框架,能够从多模态输入(例如自我中心视频和运动传感器)中跟踪和理解自我中心运动。EgoLM利用丰富的上下文来消除自我运动跟踪和理解中的歧义,这在单模态条件下是不适定的。为了促进这个通用且多模态的框架,我们的关键见解是使用大型语言模型(LLM)对自我中心运动和自然语言的联合分布进行建模。多模态传感器输入被编码并投影到语言模型的联合潜在空间中,并分别用于提示运动生成或文本生成,以实现自我运动跟踪或理解。在大规模多模态人体运动数据集上的大量实验验证了EgoLM作为通用自我中心学习通用模型的有效性。

关键词

引用

@article{arxiv.2409.18127,
  title  = {EgoLM: Multi-Modal Language Model of Egocentric Motions},
  author = {Fangzhou Hong and Vladimir Guzov and Hyo Jin Kim and Yuting Ye and Richard Newcombe and Ziwei Liu and Lingni Ma},
  journal= {arXiv preprint arXiv:2409.18127},
  year   = {2024}
}

备注

Project Page: https://hongfz16.github.io/projects/EgoLM