基于 DC 编程的语义感知无人机着陆场址评估:利用多模态大语言模型
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
安全的无人机紧急着陆不仅需要识别平坦地形,还需要理解对传统几何传感器不可见的复杂语义风险(如人群、临时结构)。本文提出一种新框架,利用遥感图像和多模态大语言模型 (Multimodal Large Language Model, MLLM) 实现全局语境感知的着陆场址评估。不同于局部几何方法,我们的方案采用粗到细管线:首先,轻量级语义分割模块高效筛选候选区域;其次,视觉语言推理智能体融合视觉特征与兴趣点 (Point-of-Interest, POI) 数据,以检测细微危险。为验证该方法,我们构建并公开发布了紧急着陆场址选择 (Emergency Landing Site Selection, ELSS) 基准数据集。实验表明,我们的框架在风险识别准确性方面显著优于几何基线方法。此外,定性结果确认其能够生成类人且可解释的依据,增强了自动化决策的可信度。该基准数据集已公开于 https://anonymous.4open.science/r/ELSS-dataset-43D7。
引用
@article{arxiv.2602.01163,
title = {Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models},
author = {Chunliang Hua and Zeyuan Yang and Lei Zhang and Jiayang Sun and Fengwen Chen and Chunlan Zeng and Xiao Hu},
journal= {arXiv preprint arXiv:2602.01163},
year = {2026}
}