聚焦低空治理中真正重要的事:一个面向管理的多模态基准与隐式协调的视觉-语言推理框架
计算机视觉与模式识别
2026-04-09 v2
摘要
低空视觉系统正成为智慧城市治理的关键基础设施。然而,现有的以物体为中心的感知范式和松散耦合的视觉-语言流水线仍然难以支持现实城市治理中所需的面向管理的异常理解。为弥合这一差距,我们引入了GovLA-10K,这是第一个面向管理的低空智能多模态基准,以及GovLA-Reasoner,一个为治理感知的空中感知量身定制的统一视觉-语言推理框架。与旨在详尽标注所有可见物体的现有研究不同,GovLA-10K是围绕直接对应实际管理需求的功能性显著目标精心设计的,并进一步提供了基于这些观察的可操作管理建议。为了有效协调细粒度视觉定位与高层上下文语言推理,GovLA-Reasoner引入了一个高效的空间感知定位适配器(SGA),该适配器隐式地协调视觉检测器与大语言模型(LLM)之间的判别性表示共享。与主要关注全局嵌入对齐的现有适配器不同,我们的SGA专门设计用于压缩和聚合多流定位感知表示,从而保留细粒度空间线索,同时使其能够有效集成到语言推理过程中。大量实验表明,我们的GovLA-Reasoner有效提升了性能,同时避免了对任何任务特定独立组件进行微调的需求。我们相信,我们的工作为未来关于管理感知的低空视觉-语言系统的研究提供了新的视角和基础。代码和数据集将在进一步整理后公开发布。
引用
@article{arxiv.2601.19640,
title = {Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework},
author = {Hao Chang and Zhihui Wang and Lingxiang Wu and Wei An and Boyang Li and Zaiping Lin and Weidong Sheng and Jinqiao Wang},
journal= {arXiv preprint arXiv:2601.19640},
year = {2026}
}