RSUniVLM:基于粒度导向的混合专家架构的遥感统一视觉语言模型
计算机视觉与模式识别
2024-12-11 v2
摘要
遥感视觉语言模型(RS VLMs)在遥感图像理解任务中取得了显著进展。尽管在多模态推理和多轮对话方面表现出色,但现有模型缺乏像素级理解能力,且在多图像输入方面存在挑战。本文提出RSUniVLM,一个面向跨多种粒度(包括图像级、区域级和像素级任务)的综合遥感VLM,旨在实现全面的视觉理解。RSUniVLM在多图像分析中也能有效工作,已实现变化检测和变化描述等实例。为提升模型在不同层次捕获视觉信息的能力且不增加模型规模,我们设计了一种名为粒度导向混合专家(Granularity-oriented Mixture of Experts)的新型架构,使模型参数数量约为10亿。我们还构建了一个大规模遥感指令跟随数据集,基于多种现有数据集(涵盖遥感和通用领域),包括目标定位、视觉问答和语义分割等多种任务。大量实验表明,所提出的RSUniVLM在各种遥感任务中均优于前沿方法。代码和模型将在\href{https://github.com/xuliu-cyber/RSUniVLM}{here}提供。
引用
@article{arxiv.2412.05679,
title = {RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts},
author = {Xu Liu and Zhouhui Lian},
journal= {arXiv preprint arXiv:2412.05679},
year = {2024}
}