EagleVision:面向遥感的目标级属性多模态大语言模型
计算机视觉与模式识别
2025-04-01 v1
摘要
多模态大语言模型(MLLMs)的最新进展已在各种视觉任务中展现出令人瞩目的成果。然而,在遥感(RS)领域,高分辨率和目标占比小给现有MLLMs带来了挑战,这些模型在处理以目标为中心的任务时表现不佳,尤其是在精确定位和每个目标的细粒度属性描述方面。这些遥感MLLMs尚未超越经典的视觉感知模型,因为它们仅提供粗略的图像理解,导致在实际场景中的收益有限。为弥补这一差距,我们构建了EagleVision,一个专为遥感定制的MLLM,擅长目标检测和属性理解。配备属性解耦模块(Attribute Disentangle module),EagleVision学习解耦视觉标记以表达不同属性。为支持目标级视觉-语言对齐,我们构建了EVAttrs-95K,这是遥感领域首个用于指令微调的大规模目标属性理解数据集,以及一个新的评估基准EVBench。EagleVision在细粒度目标检测和目标属性理解任务上均达到了最先进性能,突显了MLLMs中检测与理解能力之间的相互促进。代码、模型、数据和演示将在https://github.com/XiangTodayEatsWhat/EagleVision提供。
引用
@article{arxiv.2503.23330,
title = {EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing},
author = {Hongxiang Jiang and Jihao Yin and Qixiong Wang and Jiaqi Feng and Guo Chen},
journal= {arXiv preprint arXiv:2503.23330},
year = {2025}
}
备注
Under Review