中文

基于自我中心视觉语言模型的便携实时智能助手

计算机视觉与模式识别 2025-03-07 v1 人机交互

摘要

我们提出了Vinci,一个旨在在便携设备上提供实时、全面AI辅助的视觉语言系统。Vinci的核心是EgoVideo-VL,一种新型模型,它将自我中心视觉基础模型与大语言模型(LLM)集成,实现了场景理解、时间定位、视频摘要和未来规划等高级功能。为增强其实用性,Vinci集成了一个用于实时处理长视频流并保留上下文历史的记忆模块,一个用于生成视觉动作演示的生成模块,以及一个连接自我中心与第三人称视角以提供相关操作视频用于技能习得的检索模块。与现有通常依赖专用硬件的系统不同,Vinci是硬件无关的,支持在包括智能手机和可穿戴相机在内的广泛设备上部署。在我们的实验中,我们首先展示了EgoVideo-VL在多个公共基准上的优越性能,展示了其视觉语言推理和上下文理解能力。然后我们进行了一系列用户研究以评估Vinci在现实世界中的有效性,突出了其在不同场景中的适应性和可用性。我们希望Vinci能为便携实时自我中心AI系统建立一个新的框架,为用户提供上下文感知和可操作的洞察。Vinci的前端、后端和模型的所有代码均可在https://github.com/OpenGVLab/vinci获取。

关键词

引用

@article{arxiv.2503.04250,
  title  = {An Egocentric Vision-Language Model based Portable Real-time Smart Assistant},
  author = {Yifei Huang and Jilan Xu and Baoqi Pei and Yuping He and Guo Chen and Mingfang Zhang and Lijin Yang and Zheng Nie and Jinyao Liu and Guoshun Fan and Dechen Lin and Fang Fang and Kunpeng Li and Chang Yuan and Xinyuan Chen and Yaohui Wang and Yali Wang and Yu Qiao and Limin Wang},
  journal= {arXiv preprint arXiv:2503.04250},
  year   = {2025}
}