中文

SPOT!:面向无监督多闭路电视动态目标跟踪的地图引导大语言模型智能体

计算机视觉与模式识别 2026-01-15 v2

摘要

基于闭路电视(CCTV)的车辆跟踪系统在跨多摄像机环境连续连接同一车辆轨迹方面面临结构性限制。特别是,由于闭路电视之间的间隔和有限的视场(FOV)会产生盲区,导致目标身份(ID)切换和轨迹丢失,从而降低实时路径预测的可靠性。本文提出 SPOT(基于轨迹的空间预测),一种无需预先训练即可在多闭路电视环境的盲区中跟踪车辆的地图引导大语言模型(LLM)智能体。所提方法将道路结构(航路点)和闭路电视布设信息表示为基于二维空间坐标的文档,并通过分块技术进行组织,以实现实时查询和推理。此外,它利用在闭路电视图像中观测到的目标的相对位置和视场信息,将车辆位置转换到实际世界坐标系。通过结合地图空间信息与车辆的移动方向、速度和行驶模式,在交叉口层面执行束搜索,以推导出车辆在盲区后最可能进入的候选闭路电视位置。基于 CARLA 模拟器在虚拟城市环境中的实验结果证实,所提方法即使在盲区路段也能准确预测下一个出现的闭路电视,比现有技术更有效地维持连续的车辆轨迹。

关键词

引用

@article{arxiv.2512.20975,
  title  = {SPOT!: Map-Guided LLM Agent for Unsupervised Multi-CCTV Dynamic Object Tracking},
  author = {Yujin Roh and Inho Jake Park and Chigon Hwang},
  journal= {arXiv preprint arXiv:2512.20975},
  year   = {2026}
}

备注

33 pages, 27figures