中文

SEER-VAR:用于车辆增强现实的语义自我中心环境推理器

计算机视觉与模式识别 2025-08-26 v1 机器人学

摘要

我们提出了SEER-VAR,一个用于自我中心车辆增强现实(AR)的新型框架,统一了语义分解、上下文感知SLAM分支(CASB)和大语言模型驱动推荐。与假设静态或单视角设置的现有系统不同,SEER-VAR通过深度引导的视觉语言对齐动态分离驾驶舱和道路场景。两个SLAM分支分别跟踪各场景中的自我中心运动,而一个基于GPT的模块生成上下文感知的叠加信息,如仪表盘提示和危险警报。为支持评估,我们引入了EgoSLAM-Drive,一个真实世界数据集,包含同步的自我中心视角、6DoF真实姿态以及多样驾驶场景下的AR标注。实验表明,SEER-VAR在不同环境中实现了稳健的空间对齐和感知一致的AR渲染。作为首批探索自我中心驾驶中基于大语言模型的AR推荐的工作之一,我们通过结构化提示和详细的用户研究弥补了可比系统的不足。结果表明,SEER-VAR增强了对场景的理解、叠加信息的相关性以及驾驶的便捷性,为该方向的未来研究提供了有效基础。代码和数据集将开源。

关键词

引用

@article{arxiv.2508.17255,
  title  = {SEER-VAR: Semantic Egocentric Environment Reasoner for Vehicle Augmented Reality},
  author = {Yuzhi Lai and Shenghai Yuan and Peizheng Li and Jun Lou and Andreas Zell},
  journal= {arXiv preprint arXiv:2508.17255},
  year   = {2025}
}