中文

UniRS:通过视觉语言模型统一多时相遥感任务

计算机视觉与模式识别 2024-12-31 v1

摘要

遥感图像与自然图像之间的领域差异最近引起了广泛关注,视觉语言模型(Vision-Language Models, VLMs)在遥感多模态任务中展现出优异的泛化性能。然而,当前研究仍受限于探索如何处理不同类型的视觉输入。为填补这一差距,我们引入了\textbf{UniRS}——首个\textbf{统一}多时相\textbf{遥感}任务的视觉语言模型。UniRS 支持单张图像、双时相图像对和视频作为输入,实现了在统一框架内进行全面遥感时序分析。我们采用统一的视觉表征方法,使模型能够接受多种视觉输入。针对双时相图像对任务,我们定制了一种变化提取模块,以进一步增强时空特征提取。此外,我们设计了针对该模型推理过程的提示增强机制,利用通用 VLM 的先验知识为 UniRS 提供线索。为促进多任务知识共享,模型在混合数据集上联合微调。实验结果表明,UniRS 在包括视觉问答、变更描述和视频场景分类在内的多种任务上实现了最先进的性能,凸显了其在统一这些多时相遥感任务方面的 versatility 和 effectiveness。我们的代码和数据集将很快公开。

关键词

引用

@article{arxiv.2412.20742,
  title  = {UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models},
  author = {Yujie Li and Wenjia Xu and Guangzuo Li and Zijian Yu and Zhiwei Wei and Jiuniu Wang and Mugen Peng},
  journal= {arXiv preprint arXiv:2412.20742},
  year   = {2024}
}

备注

12 pages, 5 figures