中文

语义-几何双重压缩:基于无训练视觉标记稀释的超高分辨率遥感理解

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

多模态大语言模型(MLLM)在地球观测中展现出巨大的潜力,但处理超高分辨率(UHR)图像时产生的大量视觉标记引入了沉重的计算开销,严重制约其推理效率。现有视觉标记压缩方法主要采用静态且统一的压缩策略,忽视了遥感解释任务中内在的“语义-几何二元性”。具体而言,对象语义任务关注对象的抽象语义,受益于激进的背景剪枝;而场景几何任务严重依赖空间拓扑的完整性。为此,我们提出DualComp—a一种任务自适应的双流标记压缩框架。由轻量级预训练路由器动态指导,DualComp将特征处理解耦为两个专用路径。在对象语义流中,空间连续语义聚合器(SCSA)利用尺寸自适应聚类聚合冗余背景,同时保护小对象。在场景几何流中,指令引导结构恢复器(IGSR)引入贪心路径追踪拓扑完成机制,以重建空间骨架。在遥感基准XLRS-Bench上的实验表明,DualComp在异常低的计算成本下完成了高保真遥感解释,实现了效率和准确性的双重提升。

关键词

引用

@article{arxiv.2604.11122,
  title  = {Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding},
  author = {Yueying Li and Fengxiang Wang and Yan Li and Mingshuo Chen and Mengying Zhao and Long Lan},
  journal= {arXiv preprint arXiv:2604.11122},
  year   = {2026}
}