AlanaVLM:面向第一人称视频理解的多模态具身AI基础模型
计算机视觉与模式识别
2024-06-24 v2 人工智能
计算与语言
摘要
通过机器人或可穿戴设备部署的AI个人助理需要具身理解才能与人类有效协作。然而,当前的视觉-语言模型(VLMs)主要关注第三人称视角视频,忽视了第一人称感知经验的丰富性。为弥补这一差距,我们提出了三项关键贡献。首先,我们引入了第一人称视频理解数据集(EVUD),用于在视频字幕和问答任务上训练VLMs,这些任务专门针对第一人称视频。其次,我们提出了AlanaVLM,一个7B参数的VLM,使用参数高效方法在EVUD上训练。最后,我们在OpenEQA(一个具有挑战性的具身视频问答基准)上评估了AlanaVLM的能力。我们的模型达到了最先进的性能,比包括使用GPT-4作为规划器的强大Socratic模型在内的开源模型高出3.6%。此外,我们优于Claude 3和Gemini Pro Vision 1.0,并与Gemini Pro 1.5和GPT-4V相比展现出有竞争力的结果,甚至在空间推理上超越了后者。这项研究为构建可部署在机器人或可穿戴设备上的高效VLM铺平了道路,利用具身视频理解在日常任务中与人类无缝协作,为下一代具身AI做出贡献。
引用
@article{arxiv.2406.13807,
title = {AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding},
author = {Alessandro Suglia and Claudio Greco and Katie Baker and Jose L. Part and Ioannis Papaioannou and Arash Eshghi and Ioannis Konstas and Oliver Lemon},
journal= {arXiv preprint arXiv:2406.13807},
year = {2024}
}
备注
Code available https://github.com/alanaai/EVUD