中文

SGTA:基于场景图的多模态交通智能体

计算机视觉与模式识别 2026-04-07 v1

摘要

我们提出了基于场景图的多模态交通智能体(SGTA),一个模块化的交通视频理解框架,将结构化场景图与多模态推理相结合。SGTA 从路侧视频中构建交通场景图,包括检测、跟踪和车道提取,然后通过工具进行符号图查询和视觉输入的推理。SGTA 采用 ReAct 处理大语言模型与工具调用交织的推理痕迹,实现对复杂视频问题的可解释决策。在选取的 TUMTraffic VideoQA 数据集样本上进行实验表明,SGTA 在多种问题类型上实现了具竞争力的准确率,同时提供了透明的推理步骤。这些结果凸显了将结构化场景表示与多模态智能体集成用于交通视频理解的潜力。

关键词

引用

@article{arxiv.2604.03697,
  title  = {SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding},
  author = {Xingcheng Zhou and Mingyu Liu and Walter Zimmer and Jiajie Zhang and Alois Knoll},
  journal= {arXiv preprint arXiv:2604.03697},
  year   = {2026}
}