GeoPix:用于遥感影像像素级图像理解的多模态大语言模型
计算机视觉与模式识别
2025-03-14 v2
摘要
多模态大语言模型(MLLM)在图像和区域级别的遥感(RS)图像理解任务中取得了显著成功,如图像描述、视觉问答和视觉定位。然而,现有的 RS MLLM 缺乏像素级对话能力,这涉及针对特定实例返回分段掩码以响应用户指令。本文提出 GeoPix,一种 RS MLLM,将图像理解能力扩展至像素水平。这通过为 MLLM 配备掩码预测器实现,将视觉编码器的视觉特征转换为 LLM 分段标记嵌入的掩码。为促进 RS 影像中多尺度对象的分割,集成了用于捕获和存储整个数据集中实例级别类间地理上下文的类别可学习记忆模块。此外,为解决缺乏大规模数据集用于训练像素级 RS MLLM 的问题,我们构建了 GeoPixInstruct 数据集,包含 65,463 张图像和 140,412 个实例,每个实例都标注了文本描述、边界框和掩码。进一步,我们开发了两阶段训练策略,以平衡多模态多任务优化中文本生成和掩码预测的不同要求。广泛的实验验证了 GeoPix 在像素级分割任务中的有效性和优越性,同时在图像和区域级别基准中保持竞争性能。
引用
@article{arxiv.2501.06828,
title = {GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing},
author = {Ruizhe Ou and Yuan Hu and Fan Zhang and Jiaxin Chen and Yu Liu},
journal= {arXiv preprint arXiv:2501.06828},
year = {2025}
}