中文

远程感知图像的多模态解释:动态分辨率输入策略与多尺度视觉语言对齐机制

计算机视觉与模式识别 2026-01-12 v2

摘要

远程感知图像的多模态融合是一种核心技术,用于克服单源数据局限性并提高表面信息提取的准确性,在环境监测和城市规划等领域具有显著的应用价值。为解决现有方法的不足,包括固定分辨率无法平衡效率与细节以及单尺度对齐缺乏语义层次结构的问题,本研究提出了一种集成两个关键创新技术的视觉语言模型(VLM)框架:动态分辨率输入策略(DRIS)和多尺度视觉语言对齐机制(MS-VLAM)。具体而言,DRIS采用粗到细的方法,根据图像内容的复杂度自适应分配计算资源,从而保留关键细粒度特征并减少冗余计算开销。MS-VLAM构建了一个覆盖对象、局部区域和全局层次的三级对齐机制,系统性地捕获跨模态语义一致性,缓解了语义错位和粒度不平衡的问题。在RS-GPT4V数据集上的实验结果表明,所提出的框架在包括图像描述生成和跨模态检索等任务中显著提高了语义理解和计算效率的准确性。与常规方法相比,在BLEU-4和CIDEr等评估指标上实现了图像描述生成的卓越性能,以及在跨模态检索中实现了R@10指标的优异表现。这一技术框架为构建高效且稳健的多模态远程感知系统提供了新方法,为智能远程感知解释的工程应用提供了理论基础和技术指导。

关键词

引用

@article{arxiv.2512.23243,
  title  = {Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism},
  author = {Siyu Zhang and Lianlei Shan and Runhe Qiu},
  journal= {arXiv preprint arXiv:2512.23243},
  year   = {2026}
}