中文

无人机交通场景理解:嵌入规章的多模态网络与统一基准

计算机视觉与模式识别 2026-03-17 v2 人工智能

摘要

从无人机平台获取交通场景理解对智能交通系统至关重要,由于其灵活的部署和广域监测能力。然而,现有方法在现实监视中面临诸多挑战,因其对光学图像的重度依赖,在如夜间和雾天等恶劣照明条件下会导致显著性能下降。此外,当前的视觉问答(VQA)模型仅受限于基础感知任务,缺乏所需的领域特定规章知识来评估复杂交通行为。为此,我们提出一种 novel 多模态交通认知网络(MTCNet),实现对无人机交通场景的稳健理解。具体而言,我们设计了原型引导知识嵌入(PGKE)模块,利用来自外部交通规章记忆(TRM)的高层次语义原型,将领域特定知识锚定到视觉表征中,从而实现对复杂行为的理解并区分细粒度交通违规。此外,我们开发了质量感知谱补偿(QASC)模块,利用光学和热感知模态的互补特性,实现双向语境交换,有效补偿退化特征,确保在复杂环境下的稳健表征。此外,我们构建了 Traffic-VQA,即第一个大规模光学-热红外基准,涵盖 8,180 对齐图像和 130 万组问答对,跨 31 种多样化类型。广泛实验表明,MTCNet 在认知和感知场景中均显著优于最新方法。该数据集可在 https://github.com/YuZhang-2004/UAV-traffic-scene-understanding 获取。

关键词

引用

@article{arxiv.2603.10722,
  title  = {UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark},
  author = {Yu Zhang and Zhicheng Zhao and Ze Luo and Chenglong Li and Jin Tang},
  journal= {arXiv preprint arXiv:2603.10722},
  year   = {2026}
}