基于多模态大语言模型的遥感活动检测时空感知
图像与视频处理
2026-05-12 v1 人工智能
计算机视觉与模式识别
摘要
我们介绍了SMART-HC-VQA,这是一个基于Sentinel-2的视觉问答数据集,源自IARPA SMART Heavy Construction数据集,旨在进行人类活动的时空分析。该数据集将建筑-site标注、建筑类型标签、时间阶段标签、地理元数据和观察关系转化为自然语言问答三元组。这种方法将现有数据集重新定义为时延扩展的自动目标识别和视觉问答(VQA)挑战,将固定地理位置的site视为其属性和活动状态随稀疏卫星观测演变的目标。目前,SMART-HC-VQA包含21,837个可访问的Sentinel-2图像块、65,511个单图VQA示例以及约230万个两图时序比较示例,通过我们新颖的Image-Pairwise Combinatorial Augmentation方法生成。我们详细描述了检索和处理Sentinel-2影像、将大型卫星瓷片分割为site居中图像、保持与SMART-HC标注可追溯性,以及分析site大小、观察次数、时序覆盖范围、建筑类型和阶段标签分布的工作流程。此外,我们描述了一个基于LLaVA-NeXT Mistral-7B的多图MLLM训练框架,适应于接受多个日期图像输入并在基于元数据派生的VQA示例上进行训练。本工作为理解语言引导的遥感活动提供了一个可复现的基础,旨在不仅检测变化,还推理 ongoing processes 及其演进及潜在未来发展。
引用
@article{arxiv.2605.10739,
title = {Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model},
author = {David F. Ramirez and Tim Overman and Kristen Jaskie and Andreas Spanias},
journal= {arXiv preprint arXiv:2605.10739},
year = {2026}
}
备注
Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI