中文

遥感领域的统一理解与生成模型:空间忠实度

计算机视觉与模式识别 2026-01-27 v1 人工智能

摘要

统一遥感多模态模型表现出显著的空间反转诅咒:尽管它们能够准确识别和描述图像中物体的位置,但在文本到图像生成中往往难以忠实执行相同的空间关系,因为这些关系构成了遥感领域的核心语义信息。针对这一现象,我们提出了 Uni-RS——首个专为遥感领域设计的统一多模态模型,以显式解决理解与生成之间的空间不对称问题。具体而言,我们首先引入显式的空间布局规划,将文本指令转化为空间布局方案,将几何规划与视觉合成解耦。随后,我们通过空间感知查询监督来引导可学习的查询聚焦于指令中明确指定的空间关系。最后,我们开发了图像说明空间布局变异,以暴露模型于系统性几何一致的空间变换上。广泛的实验表明,我们的方法在文本到图像生成中显著提升了空间忠实度,同时保持在图像描述、视觉定位和 VQA 等多模态理解任务上的强大性能。

关键词

引用

@article{arxiv.2601.17673,
  title  = {Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing},
  author = {Weiyu Zhang and Yuan Hu and Yong Li and Yu Liu},
  journal= {arXiv preprint arXiv:2601.17673},
  year   = {2026}
}