以语言为中心的遥感图像智能解译:原理、方法与挑战
人工智能
2026-01-28 v2
摘要
遥感图像解译的主流范式长期由以视觉为中心的模型主导,这些模型依赖视觉特征进行语义理解。然而,这些模型在处理多模态推理、语义抽象和交互式决策方面面临固有的局限性。尽管近期进展已将大语言模型(LLMs)引入遥感工作流程,但现有研究主要集中在下游应用,缺乏一个统一的、能解释语言认知作用的理论框架。本综述倡导从以视觉为中心向以语言为中心的遥感解译范式转变。受人类认知的全局工作空间理论(GWT)启发,我们提出一个以语言为中心的遥感解译框架,将大语言模型视为认知中枢,整合感知空间、任务空间、知识空间和行动空间,以实现统一的理解、推理和决策。我们首先探讨了大语言模型作为遥感解译中核心认知组件的潜力,然后总结了核心技术挑战,包括统一多模态表示、知识关联以及推理与决策。此外,我们构建了一个全局工作空间驱动的解译机制,并回顾了以语言为中心的解决方案如何应对各项挑战。最后,我们从多模态数据自适应对齐、动态知识约束下的任务理解、可信推理和自主交互四个角度,概述了未来的研究方向。本工作旨在为下一代遥感解译系统提供概念基础,并建立一条通往认知驱动的智能地理空间分析的发展路线图。
引用
@article{arxiv.2508.06832,
title = {Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges},
author = {Haifeng Li and Wang Guo and Haiyang Wu and Mengwei Wu and Jipeng Zhang and Qing Zhu and Yu Liu and Xin Huang and Chao Tao},
journal= {arXiv preprint arXiv:2508.06832},
year = {2026}
}