遥感领域视觉与语言任务的高效编码器模型
计算机视觉与模式识别
2025-12-18 v1
摘要
遥感领域近期涌现了基于大视觉语言模型 (LVLMs) 的方法,这些方法能够处理计算机视觉与自然语言处理交叉领域的多项任务。为了充分利用此类模型的潜力,大量研究集中在收集覆盖多种遥感特定任务的大规模训练数据上,例如图像描述生成或视觉问答。然而,由于参数数量庞大,使用和训练 LVLMs 的成本很高。虽然已探索了多种参数高效适配技术,但这些模型的训练和推理计算成本对大多数机构而言仍然难以承受。在这项工作中,我们探索仅使用编码器架构,并提出了一种能够在保持参数紧凑的同时有效处理多任务学习的模型。特别地,我们的模型解决了通常不会在统一模型中探索的任务组合:从遥感图像生成文本和跨模态检索。我们命名为 GeoMELT(Multi-task Efficient Learning Transformer)的模型在已建立的基准测试上的结果证实了所提方法的有效性和高效性。
引用
@article{arxiv.2512.15531,
title = {An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain},
author = {João Daniel Silva and Joao Magalhaes and Devis Tuia and Bruno Martins},
journal= {arXiv preprint arXiv:2512.15531},
year = {2025}
}